Implementace prevodu HTML na PDF
Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF. Navrzena pro dokumenty o stovkach az tisicich stranek. Rendering: - WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova narocnost, bez JavaScriptu - Chromium pres Playwright pro dokumenty dokreslovane skripty - rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu Velke dokumenty: - deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky nebo odstavce - dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu se ctou z kotev hlasenych u kazde stranky - cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru - Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu API: - POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu, stahovanim vysledku, rusenim a volitelnym callbackem - GET /health s overenim dostupnosti obou enginu a stavem fronty - OpenAPI respektuje prefix reverse proxy pres root_path Bezpecnost a provoz: - SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku prohlizece - nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu - fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni oznaci jako failed, nezmizi potichu - strukturovane JSON logovani s job_id - vsechny limity vypnute ve vychozim stavu Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium a fonty s ceskou diakritikou. Autentizace zamerne neni implementovana, zpusob predavani neni domluveny. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 5
parent
e3cc8f418b
commit
156289fe2d
@@ -0,0 +1,65 @@
|
||||
"""Temporary storage of job working directories and results.
|
||||
|
||||
Nothing is kept longer than needed. A result lives until it is picked up or
|
||||
until its TTL expires, whichever comes first.
|
||||
"""
|
||||
|
||||
from __future__ import annotations
|
||||
|
||||
import logging
|
||||
import shutil
|
||||
from pathlib import Path
|
||||
|
||||
logger = logging.getLogger(__name__)
|
||||
|
||||
RESULT_NAME = "result.pdf"
|
||||
|
||||
|
||||
class Storage:
|
||||
def __init__(self, root: str) -> None:
|
||||
self.root = Path(root)
|
||||
self.root.mkdir(parents=True, exist_ok=True)
|
||||
|
||||
def job_dir(self, job_id: str) -> Path:
|
||||
path = self.root / job_id
|
||||
path.mkdir(parents=True, exist_ok=True)
|
||||
return path
|
||||
|
||||
def result_path(self, job_id: str) -> Path:
|
||||
return self.root / job_id / RESULT_NAME
|
||||
|
||||
def publish(self, job_id: str, produced: Path) -> Path:
|
||||
"""Move the produced file to its final name and drop the intermediates."""
|
||||
target = self.result_path(job_id)
|
||||
if produced != target:
|
||||
produced.replace(target)
|
||||
|
||||
for item in self.job_dir(job_id).iterdir():
|
||||
if item.name == RESULT_NAME:
|
||||
continue
|
||||
self._remove(item)
|
||||
|
||||
return target
|
||||
|
||||
def discard(self, job_id: str) -> None:
|
||||
self._remove(self.root / job_id)
|
||||
|
||||
def _remove(self, path: Path) -> None:
|
||||
try:
|
||||
if path.is_dir():
|
||||
shutil.rmtree(path, ignore_errors=False)
|
||||
elif path.exists():
|
||||
path.unlink()
|
||||
except OSError as exc:
|
||||
logger.warning("Could not remove temporary path", extra={"path": str(path)}, exc_info=exc)
|
||||
|
||||
def sweep_orphans(self, known_job_ids: set[str]) -> int:
|
||||
"""Remove directories that belong to no known job, for example after a restart."""
|
||||
removed = 0
|
||||
for item in self.root.iterdir():
|
||||
if item.is_dir() and item.name not in known_job_ids:
|
||||
self._remove(item)
|
||||
removed += 1
|
||||
if removed:
|
||||
logger.info("Removed orphaned job directories", extra={"count": removed})
|
||||
return removed
|
||||
Reference in New Issue
Block a user