Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF. Navrzena pro dokumenty o stovkach az tisicich stranek. Rendering: - WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova narocnost, bez JavaScriptu - Chromium pres Playwright pro dokumenty dokreslovane skripty - rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu Velke dokumenty: - deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky nebo odstavce - dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu se ctou z kotev hlasenych u kazde stranky - cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru - Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu API: - POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu, stahovanim vysledku, rusenim a volitelnym callbackem - GET /health s overenim dostupnosti obou enginu a stavem fronty - OpenAPI respektuje prefix reverse proxy pres root_path Bezpecnost a provoz: - SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku prohlizece - nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu - fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni oznaci jako failed, nezmizi potichu - strukturovane JSON logovani s job_id - vsechny limity vypnute ve vychozim stavu Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium a fonty s ceskou diakritikou. Autentizace zamerne neni implementovana, zpusob predavani neni domluveny. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
59 lines
1.9 KiB
Python
59 lines
1.9 KiB
Python
"""Structured JSON logging.
|
|
|
|
Every log record is a single JSON line. Anything related to a job carries the
|
|
job_id so the whole conversion can be reconstructed from the log.
|
|
"""
|
|
|
|
import json
|
|
import logging
|
|
import sys
|
|
from contextvars import ContextVar
|
|
|
|
current_job_id: ContextVar[str | None] = ContextVar("current_job_id", default=None)
|
|
|
|
_RESERVED = {
|
|
"args", "asctime", "created", "exc_info", "exc_text", "filename", "funcName",
|
|
"levelname", "levelno", "lineno", "module", "msecs", "message", "msg", "name",
|
|
"pathname", "process", "processName", "relativeCreated", "stack_info",
|
|
"thread", "threadName", "taskName",
|
|
}
|
|
|
|
|
|
class JsonFormatter(logging.Formatter):
|
|
def format(self, record: logging.LogRecord) -> str:
|
|
payload: dict[str, object] = {
|
|
"ts": self.formatTime(record, "%Y-%m-%dT%H:%M:%S%z"),
|
|
"level": record.levelname,
|
|
"logger": record.name,
|
|
"message": record.getMessage(),
|
|
}
|
|
|
|
job_id = getattr(record, "job_id", None) or current_job_id.get()
|
|
if job_id:
|
|
payload["job_id"] = job_id
|
|
|
|
for key, value in record.__dict__.items():
|
|
if key not in _RESERVED and not key.startswith("_") and key != "job_id":
|
|
payload[key] = value
|
|
|
|
if record.exc_info:
|
|
payload["exception"] = self.formatException(record.exc_info)
|
|
|
|
return json.dumps(payload, ensure_ascii=False, default=str)
|
|
|
|
|
|
def setup_logging(level: str) -> None:
|
|
handler = logging.StreamHandler(sys.stdout)
|
|
handler.setFormatter(JsonFormatter())
|
|
|
|
root = logging.getLogger()
|
|
root.handlers.clear()
|
|
root.addHandler(handler)
|
|
root.setLevel(getattr(logging, level, logging.INFO))
|
|
|
|
# uvicorn keeps its own handlers, route them through ours as well
|
|
for name in ("uvicorn", "uvicorn.access", "uvicorn.error"):
|
|
logger = logging.getLogger(name)
|
|
logger.handlers.clear()
|
|
logger.propagate = True
|