Implementace prevodu HTML na PDF

Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF.
Navrzena pro dokumenty o stovkach az tisicich stranek.

Rendering:
- WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova
  narocnost, bez JavaScriptu
- Chromium pres Playwright pro dokumenty dokreslovane skripty
- rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu

Velke dokumenty:
- deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky
  nebo odstavce
- dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu
  se ctou z kotev hlasenych u kazde stranky
- cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu
  nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru
- Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu

API:
- POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu,
  stahovanim vysledku, rusenim a volitelnym callbackem
- GET /health s overenim dostupnosti obou enginu a stavem fronty
- OpenAPI respektuje prefix reverse proxy pres root_path

Bezpecnost a provoz:
- SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku
  prohlizece
- nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu
- fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni
  oznaci jako failed, nezmizi potichu
- strukturovane JSON logovani s job_id
- vsechny limity vypnute ve vychozim stavu

Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium
a fonty s ceskou diakritikou.

Autentizace zamerne neni implementovana, zpusob predavani neni domluveny.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
JiriUhlir
2026-08-27 14:50:10 +02:00
co-authored by Claude Opus 5
parent e3cc8f418b
commit 156289fe2d
48 changed files with 4043 additions and 24 deletions
+69
View File
@@ -0,0 +1,69 @@
"""HTTP surface of the service."""
from __future__ import annotations
import pytest
from fastapi.testclient import TestClient
from app.main import app
@pytest.fixture
def client():
with TestClient(app) as test_client:
yield test_client
def test_health_is_available(client) -> None:
response = client.get("/health")
assert response.status_code == 200
body = response.json()
assert body["status"] in ("ok", "degraded")
assert "engines" in body
def test_version_reports_the_application(client) -> None:
response = client.get("/version")
assert response.status_code == 200
assert response.json()["language"] == "python"
def test_openapi_is_generated(client) -> None:
response = client.get("/openapi.json")
assert response.status_code == 200
paths = response.json()["paths"]
assert "/convert" in paths
assert "/jobs" in paths
assert "/jobs/{job_id}/result" in paths
def test_source_requires_exactly_one_input(client) -> None:
response = client.post(
"/convert",
json={"source": {"url": "https://example.com/a.html", "html": "<html></html>"}},
)
assert response.status_code == 422
def test_empty_source_is_rejected(client) -> None:
response = client.post("/convert", json={"source": {}})
assert response.status_code == 422
def test_private_address_is_refused(client) -> None:
response = client.post("/convert", json={"source": {"url": "http://127.0.0.1:8000/a.html"}})
assert response.status_code == 400
assert response.json()["error_code"] == "blocked_target"
def test_unknown_job_returns_404(client) -> None:
response = client.get("/jobs/00000000-0000-0000-0000-000000000000")
assert response.status_code == 404
assert response.json()["error_code"] == "job_not_found"