Implementace prevodu HTML na PDF

Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF.
Navrzena pro dokumenty o stovkach az tisicich stranek.

Rendering:
- WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova
  narocnost, bez JavaScriptu
- Chromium pres Playwright pro dokumenty dokreslovane skripty
- rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu

Velke dokumenty:
- deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky
  nebo odstavce
- dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu
  se ctou z kotev hlasenych u kazde stranky
- cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu
  nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru
- Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu

API:
- POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu,
  stahovanim vysledku, rusenim a volitelnym callbackem
- GET /health s overenim dostupnosti obou enginu a stavem fronty
- OpenAPI respektuje prefix reverse proxy pres root_path

Bezpecnost a provoz:
- SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku
  prohlizece
- nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu
- fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni
  oznaci jako failed, nezmizi potichu
- strukturovane JSON logovani s job_id
- vsechny limity vypnute ve vychozim stavu

Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium
a fonty s ceskou diakritikou.

Autentizace zamerne neni implementovana, zpusob predavani neni domluveny.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
JiriUhlir
2026-08-27 14:50:10 +02:00
co-authored by Claude Opus 5
parent e3cc8f418b
commit 156289fe2d
48 changed files with 4043 additions and 24 deletions
+67 -1
View File
@@ -1,3 +1,69 @@
# html-to-pdf
Generated by AppFactory.
Sluzba prevadi HTML dokument na PDF. Prijme adresu dokumentu nebo HTML primo
v tele requestu a vrati soubor PDF. Je navrzena pro dokumenty o stovkach az
tisicich stranek.
Bezi v AppFactory na `https://services.csbot.cz/apps/html-to-pdf`.
## Jak to funguje
Dva render enginy:
- **WeasyPrint** je vychozi. Ma spravne CSS Paged Media, tedy countery stranek,
opakovane hlavicky tabulek a zalozky. Nizka pametova narocnost. Nespousti
JavaScript.
- **Chromium** pres Playwright zvladne i dokumenty dokreslovane JavaScriptem.
Nema pouzitelne countery stranek, cisla se proto dopisuji do hotoveho PDF.
Velke dokumenty se renderuji po castech a vysledky se slucuji. Cisla stranek
a obsah se dopocitavaji dvoupruchodovym renderem, aby po slouceni sedely.
## Spusteni
```bash
docker build -t html-to-pdf .
docker run --rm -p 8000:8000 html-to-pdf
```
## Priklad volani
Maly dokument synchronne:
```bash
curl -X POST http://localhost:8000/convert \
-H "Content-Type: application/json" \
-d '{"source": {"url": "https://example.com/dokument.html"}}' \
--output dokument.pdf
```
Velky dokument asynchronne:
```bash
# zarazeni do fronty
curl -X POST http://localhost:8000/jobs \
-H "Content-Type: application/json" \
-d '{
"source": {"url": "https://example.com/velky.html"},
"page_numbers": {"enabled": true},
"toc": {"enabled": true}
}'
# stav
curl http://localhost:8000/jobs/<job_id>
# stazeni
curl http://localhost:8000/jobs/<job_id>/result --output velky.pdf
```
## Dokumentace
Podrobnosti jsou ve slozce [documentation](documentation/README.md):
- [api.md](documentation/api.md) endpointy a telo requestu
- [architektura.md](documentation/architektura.md) jak sluzba funguje uvnitr
- [konfigurace.md](documentation/konfigurace.md) environment variables
- [provoz.md](documentation/provoz.md) nasazeni a znama omezeni
- [zmeny.md](documentation/zmeny.md) zaznam zmen
Interaktivni dokumentace API je na `/docs`.