Files
html-to-pdf/documentation/README.md
T
JiriUhlirandClaude Opus 5 156289fe2d Implementace prevodu HTML na PDF
Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF.
Navrzena pro dokumenty o stovkach az tisicich stranek.

Rendering:
- WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova
  narocnost, bez JavaScriptu
- Chromium pres Playwright pro dokumenty dokreslovane skripty
- rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu

Velke dokumenty:
- deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky
  nebo odstavce
- dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu
  se ctou z kotev hlasenych u kazde stranky
- cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu
  nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru
- Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu

API:
- POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu,
  stahovanim vysledku, rusenim a volitelnym callbackem
- GET /health s overenim dostupnosti obou enginu a stavem fronty
- OpenAPI respektuje prefix reverse proxy pres root_path

Bezpecnost a provoz:
- SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku
  prohlizece
- nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu
- fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni
  oznaci jako failed, nezmizi potichu
- strukturovane JSON logovani s job_id
- vsechny limity vypnute ve vychozim stavu

Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium
a fonty s ceskou diakritikou.

Autentizace zamerne neni implementovana, zpusob predavani neni domluveny.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-27 14:50:10 +02:00

1.9 KiB

Dokumentace sluzby html-to-pdf

Sluzba prevadi HTML dokument na PDF. Prijme adresu dokumentu nebo HTML primo v tele requestu a vrati soubor PDF. Zvlada dokumenty o tisicich stranek.

Obsah dokumentace

Aktualni stav

Verze 1.0.0, stav development.

Hotovo:

  • synchronni endpoint POST /convert
  • asynchronni endpoint POST /jobs se sledovanim stavu a stahovanim vysledku
  • dva render enginy, weasyprint a chromium, plus rezim auto
  • chunkovani velkych dokumentu a slucovani vysledku
  • dvoupruchodovy render obsahu se skutecnymi cisly stranek
  • cislovani stranek pres CSS countery nebo pres cislovaci vrstvu
  • SSRF ochrana s kontrolou po DNS resolvu a na kazdem presmerovani
  • hlaseni nedostupnych assetu v odpovedi jobu
  • fronta s omezenym poctem paralelnich workeru
  • volitelny callback po dokonceni jobu
  • strukturovane JSON logovani s job_id

Neni hotovo a neni ani v zadani:

  • autentizace. Sluzba je bez overovani, pristup resi reverse proxy. Pokud ma byt chranena, je potreba se domluvit na zpusobu, typicky hlavicka X-Api-Key. Do te doby zadna neni.
  • trvala fronta. Restart sluzby znamena ztratu rozpracovanych jobu, ty se oznaci jako failed s duvodem service_restarted.

Rychly priklad

curl -X POST https://services.csbot.cz/apps/html-to-pdf/convert \
  -H "Content-Type: application/json" \
  -d '{"source": {"url": "https://example.com/dokument.html"}}' \
  --output dokument.pdf

Pro velky dokument se pouziva asynchronni cesta:

curl -X POST https://services.csbot.cz/apps/html-to-pdf/jobs \
  -H "Content-Type: application/json" \
  -d '{"source": {"url": "https://example.com/velky.html"}, "toc": {"enabled": true}}'