Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF. Navrzena pro dokumenty o stovkach az tisicich stranek. Rendering: - WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova narocnost, bez JavaScriptu - Chromium pres Playwright pro dokumenty dokreslovane skripty - rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu Velke dokumenty: - deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky nebo odstavce - dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu se ctou z kotev hlasenych u kazde stranky - cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru - Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu API: - POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu, stahovanim vysledku, rusenim a volitelnym callbackem - GET /health s overenim dostupnosti obou enginu a stavem fronty - OpenAPI respektuje prefix reverse proxy pres root_path Bezpecnost a provoz: - SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku prohlizece - nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu - fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni oznaci jako failed, nezmizi potichu - strukturovane JSON logovani s job_id - vsechny limity vypnute ve vychozim stavu Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium a fonty s ceskou diakritikou. Autentizace zamerne neni implementovana, zpusob predavani neni domluveny. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
66 lines
2.0 KiB
Python
66 lines
2.0 KiB
Python
"""Temporary storage of job working directories and results.
|
|
|
|
Nothing is kept longer than needed. A result lives until it is picked up or
|
|
until its TTL expires, whichever comes first.
|
|
"""
|
|
|
|
from __future__ import annotations
|
|
|
|
import logging
|
|
import shutil
|
|
from pathlib import Path
|
|
|
|
logger = logging.getLogger(__name__)
|
|
|
|
RESULT_NAME = "result.pdf"
|
|
|
|
|
|
class Storage:
|
|
def __init__(self, root: str) -> None:
|
|
self.root = Path(root)
|
|
self.root.mkdir(parents=True, exist_ok=True)
|
|
|
|
def job_dir(self, job_id: str) -> Path:
|
|
path = self.root / job_id
|
|
path.mkdir(parents=True, exist_ok=True)
|
|
return path
|
|
|
|
def result_path(self, job_id: str) -> Path:
|
|
return self.root / job_id / RESULT_NAME
|
|
|
|
def publish(self, job_id: str, produced: Path) -> Path:
|
|
"""Move the produced file to its final name and drop the intermediates."""
|
|
target = self.result_path(job_id)
|
|
if produced != target:
|
|
produced.replace(target)
|
|
|
|
for item in self.job_dir(job_id).iterdir():
|
|
if item.name == RESULT_NAME:
|
|
continue
|
|
self._remove(item)
|
|
|
|
return target
|
|
|
|
def discard(self, job_id: str) -> None:
|
|
self._remove(self.root / job_id)
|
|
|
|
def _remove(self, path: Path) -> None:
|
|
try:
|
|
if path.is_dir():
|
|
shutil.rmtree(path, ignore_errors=False)
|
|
elif path.exists():
|
|
path.unlink()
|
|
except OSError as exc:
|
|
logger.warning("Could not remove temporary path", extra={"path": str(path)}, exc_info=exc)
|
|
|
|
def sweep_orphans(self, known_job_ids: set[str]) -> int:
|
|
"""Remove directories that belong to no known job, for example after a restart."""
|
|
removed = 0
|
|
for item in self.root.iterdir():
|
|
if item.is_dir() and item.name not in known_job_ids:
|
|
self._remove(item)
|
|
removed += 1
|
|
if removed:
|
|
logger.info("Removed orphaned job directories", extra={"count": removed})
|
|
return removed
|