Implementace prevodu HTML na PDF
Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF. Navrzena pro dokumenty o stovkach az tisicich stranek. Rendering: - WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova narocnost, bez JavaScriptu - Chromium pres Playwright pro dokumenty dokreslovane skripty - rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu Velke dokumenty: - deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky nebo odstavce - dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu se ctou z kotev hlasenych u kazde stranky - cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru - Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu API: - POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu, stahovanim vysledku, rusenim a volitelnym callbackem - GET /health s overenim dostupnosti obou enginu a stavem fronty - OpenAPI respektuje prefix reverse proxy pres root_path Bezpecnost a provoz: - SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku prohlizece - nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu - fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni oznaci jako failed, nezmizi potichu - strukturovane JSON logovani s job_id - vsechny limity vypnute ve vychozim stavu Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium a fonty s ceskou diakritikou. Autentizace zamerne neni implementovana, zpusob predavani neni domluveny. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 5
parent
e3cc8f418b
commit
156289fe2d
@@ -0,0 +1,39 @@
|
||||
"""Measurement fixture for a document of roughly twelve hundred pages.
|
||||
|
||||
Marked slow on purpose. It is here to measure memory and wall clock time of the
|
||||
chunked pipeline, not to assert exact numbers.
|
||||
"""
|
||||
|
||||
from __future__ import annotations
|
||||
|
||||
import time
|
||||
|
||||
import pytest
|
||||
|
||||
pytest.importorskip("weasyprint")
|
||||
|
||||
from app.config import Settings # noqa: E402
|
||||
from app.engines.weasy import WeasyPrintEngine # noqa: E402
|
||||
from app.models import ChunkSettings, ConvertRequest, PageNumbers, Source # noqa: E402
|
||||
from app.services.pipeline import ConversionPipeline # noqa: E402
|
||||
|
||||
pytestmark = [pytest.mark.asyncio, pytest.mark.slow]
|
||||
|
||||
|
||||
async def test_large_document_renders_in_chunks(tmp_path, large_document: str) -> None:
|
||||
pipeline = ConversionPipeline({"weasyprint": WeasyPrintEngine()}, Settings())
|
||||
request = ConvertRequest(
|
||||
source=Source(html=large_document),
|
||||
engine="weasyprint",
|
||||
page_numbers=PageNumbers(enabled=True),
|
||||
chunking=ChunkSettings(enabled=True, pages_per_chunk=50),
|
||||
)
|
||||
|
||||
started = time.monotonic()
|
||||
result = await pipeline.run(request, tmp_path)
|
||||
duration = time.monotonic() - started
|
||||
|
||||
print(f"stranek: {result.page_count}, cas: {duration:.1f} s")
|
||||
|
||||
assert result.page_count > 1000
|
||||
assert result.path.exists()
|
||||
Reference in New Issue
Block a user