Files
html-to-pdf/app/pdf/merger.py
T
JiriUhlirandClaude Opus 5 156289fe2d Implementace prevodu HTML na PDF
Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF.
Navrzena pro dokumenty o stovkach az tisicich stranek.

Rendering:
- WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova
  narocnost, bez JavaScriptu
- Chromium pres Playwright pro dokumenty dokreslovane skripty
- rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu

Velke dokumenty:
- deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky
  nebo odstavce
- dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu
  se ctou z kotev hlasenych u kazde stranky
- cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu
  nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru
- Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu

API:
- POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu,
  stahovanim vysledku, rusenim a volitelnym callbackem
- GET /health s overenim dostupnosti obou enginu a stavem fronty
- OpenAPI respektuje prefix reverse proxy pres root_path

Bezpecnost a provoz:
- SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku
  prohlizece
- nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu
- fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni
  oznaci jako failed, nezmizi potichu
- strukturovane JSON logovani s job_id
- vsechny limity vypnute ve vychozim stavu

Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium
a fonty s ceskou diakritikou.

Autentizace zamerne neni implementovana, zpusob predavani neni domluveny.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-27 14:50:10 +02:00

54 lines
1.4 KiB
Python

"""Merging of chunk PDFs and reading of basic page geometry."""
from __future__ import annotations
import logging
from pathlib import Path
logger = logging.getLogger(__name__)
def merge(paths: list[Path], output_path: Path) -> int:
"""Concatenate chunk PDFs into one file.
PdfWriter.append is used on purpose, it carries over bookmarks and internal
links and shifts their page references by the running offset.
"""
from pypdf import PdfWriter
if not paths:
raise ValueError("Neni co slucovat, seznam PDF je prazdny.")
if len(paths) == 1:
paths[0].replace(output_path)
return page_count(output_path)
writer = PdfWriter()
try:
for path in paths:
writer.append(str(path))
with output_path.open("wb") as handle:
writer.write(handle)
finally:
writer.close()
total = page_count(output_path)
logger.info("Chunks merged", extra={"chunks": len(paths), "pages": total})
return total
def page_count(path: Path) -> int:
from pypdf import PdfReader
with path.open("rb") as handle:
return len(PdfReader(handle).pages)
def first_page_size(path: Path) -> tuple[float, float]:
"""Width and height of the first page in points."""
from pypdf import PdfReader
with path.open("rb") as handle:
box = PdfReader(handle).pages[0].mediabox
return float(box.width), float(box.height)