Implementace prevodu HTML na PDF
Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF. Navrzena pro dokumenty o stovkach az tisicich stranek. Rendering: - WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova narocnost, bez JavaScriptu - Chromium pres Playwright pro dokumenty dokreslovane skripty - rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu Velke dokumenty: - deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky nebo odstavce - dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu se ctou z kotev hlasenych u kazde stranky - cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru - Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu API: - POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu, stahovanim vysledku, rusenim a volitelnym callbackem - GET /health s overenim dostupnosti obou enginu a stavem fronty - OpenAPI respektuje prefix reverse proxy pres root_path Bezpecnost a provoz: - SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku prohlizece - nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu - fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni oznaci jako failed, nezmizi potichu - strukturovane JSON logovani s job_id - vsechny limity vypnute ve vychozim stavu Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium a fonty s ceskou diakritikou. Autentizace zamerne neni implementovana, zpusob predavani neni domluveny. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 5
parent
e3cc8f418b
commit
156289fe2d
@@ -0,0 +1,53 @@
|
||||
"""Merging of chunk PDFs and reading of basic page geometry."""
|
||||
|
||||
from __future__ import annotations
|
||||
|
||||
import logging
|
||||
from pathlib import Path
|
||||
|
||||
logger = logging.getLogger(__name__)
|
||||
|
||||
|
||||
def merge(paths: list[Path], output_path: Path) -> int:
|
||||
"""Concatenate chunk PDFs into one file.
|
||||
|
||||
PdfWriter.append is used on purpose, it carries over bookmarks and internal
|
||||
links and shifts their page references by the running offset.
|
||||
"""
|
||||
from pypdf import PdfWriter
|
||||
|
||||
if not paths:
|
||||
raise ValueError("Neni co slucovat, seznam PDF je prazdny.")
|
||||
|
||||
if len(paths) == 1:
|
||||
paths[0].replace(output_path)
|
||||
return page_count(output_path)
|
||||
|
||||
writer = PdfWriter()
|
||||
try:
|
||||
for path in paths:
|
||||
writer.append(str(path))
|
||||
with output_path.open("wb") as handle:
|
||||
writer.write(handle)
|
||||
finally:
|
||||
writer.close()
|
||||
|
||||
total = page_count(output_path)
|
||||
logger.info("Chunks merged", extra={"chunks": len(paths), "pages": total})
|
||||
return total
|
||||
|
||||
|
||||
def page_count(path: Path) -> int:
|
||||
from pypdf import PdfReader
|
||||
|
||||
with path.open("rb") as handle:
|
||||
return len(PdfReader(handle).pages)
|
||||
|
||||
|
||||
def first_page_size(path: Path) -> tuple[float, float]:
|
||||
"""Width and height of the first page in points."""
|
||||
from pypdf import PdfReader
|
||||
|
||||
with path.open("rb") as handle:
|
||||
box = PdfReader(handle).pages[0].mediabox
|
||||
return float(box.width), float(box.height)
|
||||
Reference in New Issue
Block a user