Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF. Navrzena pro dokumenty o stovkach az tisicich stranek. Rendering: - WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova narocnost, bez JavaScriptu - Chromium pres Playwright pro dokumenty dokreslovane skripty - rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu Velke dokumenty: - deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky nebo odstavce - dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu se ctou z kotev hlasenych u kazde stranky - cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru - Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu API: - POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu, stahovanim vysledku, rusenim a volitelnym callbackem - GET /health s overenim dostupnosti obou enginu a stavem fronty - OpenAPI respektuje prefix reverse proxy pres root_path Bezpecnost a provoz: - SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku prohlizece - nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu - fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni oznaci jako failed, nezmizi potichu - strukturovane JSON logovani s job_id - vsechny limity vypnute ve vychozim stavu Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium a fonty s ceskou diakritikou. Autentizace zamerne neni implementovana, zpusob predavani neni domluveny. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
54 lines
1.4 KiB
Python
54 lines
1.4 KiB
Python
"""Merging of chunk PDFs and reading of basic page geometry."""
|
|
|
|
from __future__ import annotations
|
|
|
|
import logging
|
|
from pathlib import Path
|
|
|
|
logger = logging.getLogger(__name__)
|
|
|
|
|
|
def merge(paths: list[Path], output_path: Path) -> int:
|
|
"""Concatenate chunk PDFs into one file.
|
|
|
|
PdfWriter.append is used on purpose, it carries over bookmarks and internal
|
|
links and shifts their page references by the running offset.
|
|
"""
|
|
from pypdf import PdfWriter
|
|
|
|
if not paths:
|
|
raise ValueError("Neni co slucovat, seznam PDF je prazdny.")
|
|
|
|
if len(paths) == 1:
|
|
paths[0].replace(output_path)
|
|
return page_count(output_path)
|
|
|
|
writer = PdfWriter()
|
|
try:
|
|
for path in paths:
|
|
writer.append(str(path))
|
|
with output_path.open("wb") as handle:
|
|
writer.write(handle)
|
|
finally:
|
|
writer.close()
|
|
|
|
total = page_count(output_path)
|
|
logger.info("Chunks merged", extra={"chunks": len(paths), "pages": total})
|
|
return total
|
|
|
|
|
|
def page_count(path: Path) -> int:
|
|
from pypdf import PdfReader
|
|
|
|
with path.open("rb") as handle:
|
|
return len(PdfReader(handle).pages)
|
|
|
|
|
|
def first_page_size(path: Path) -> tuple[float, float]:
|
|
"""Width and height of the first page in points."""
|
|
from pypdf import PdfReader
|
|
|
|
with path.open("rb") as handle:
|
|
box = PdfReader(handle).pages[0].mediabox
|
|
return float(box.width), float(box.height)
|