Files
html-to-pdf/app/services/storage.py
T
JiriUhlirandClaude Opus 5 156289fe2d Implementace prevodu HTML na PDF
Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF.
Navrzena pro dokumenty o stovkach az tisicich stranek.

Rendering:
- WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova
  narocnost, bez JavaScriptu
- Chromium pres Playwright pro dokumenty dokreslovane skripty
- rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu

Velke dokumenty:
- deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky
  nebo odstavce
- dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu
  se ctou z kotev hlasenych u kazde stranky
- cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu
  nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru
- Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu

API:
- POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu,
  stahovanim vysledku, rusenim a volitelnym callbackem
- GET /health s overenim dostupnosti obou enginu a stavem fronty
- OpenAPI respektuje prefix reverse proxy pres root_path

Bezpecnost a provoz:
- SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku
  prohlizece
- nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu
- fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni
  oznaci jako failed, nezmizi potichu
- strukturovane JSON logovani s job_id
- vsechny limity vypnute ve vychozim stavu

Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium
a fonty s ceskou diakritikou.

Autentizace zamerne neni implementovana, zpusob predavani neni domluveny.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-27 14:50:10 +02:00

66 lines
2.0 KiB
Python

"""Temporary storage of job working directories and results.
Nothing is kept longer than needed. A result lives until it is picked up or
until its TTL expires, whichever comes first.
"""
from __future__ import annotations
import logging
import shutil
from pathlib import Path
logger = logging.getLogger(__name__)
RESULT_NAME = "result.pdf"
class Storage:
def __init__(self, root: str) -> None:
self.root = Path(root)
self.root.mkdir(parents=True, exist_ok=True)
def job_dir(self, job_id: str) -> Path:
path = self.root / job_id
path.mkdir(parents=True, exist_ok=True)
return path
def result_path(self, job_id: str) -> Path:
return self.root / job_id / RESULT_NAME
def publish(self, job_id: str, produced: Path) -> Path:
"""Move the produced file to its final name and drop the intermediates."""
target = self.result_path(job_id)
if produced != target:
produced.replace(target)
for item in self.job_dir(job_id).iterdir():
if item.name == RESULT_NAME:
continue
self._remove(item)
return target
def discard(self, job_id: str) -> None:
self._remove(self.root / job_id)
def _remove(self, path: Path) -> None:
try:
if path.is_dir():
shutil.rmtree(path, ignore_errors=False)
elif path.exists():
path.unlink()
except OSError as exc:
logger.warning("Could not remove temporary path", extra={"path": str(path)}, exc_info=exc)
def sweep_orphans(self, known_job_ids: set[str]) -> int:
"""Remove directories that belong to no known job, for example after a restart."""
removed = 0
for item in self.root.iterdir():
if item.is_dir() and item.name not in known_job_ids:
self._remove(item)
removed += 1
if removed:
logger.info("Removed orphaned job directories", extra={"count": removed})
return removed