Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF. Navrzena pro dokumenty o stovkach az tisicich stranek. Rendering: - WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova narocnost, bez JavaScriptu - Chromium pres Playwright pro dokumenty dokreslovane skripty - rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu Velke dokumenty: - deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky nebo odstavce - dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu se ctou z kotev hlasenych u kazde stranky - cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru - Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu API: - POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu, stahovanim vysledku, rusenim a volitelnym callbackem - GET /health s overenim dostupnosti obou enginu a stavem fronty - OpenAPI respektuje prefix reverse proxy pres root_path Bezpecnost a provoz: - SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku prohlizece - nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu - fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni oznaci jako failed, nezmizi potichu - strukturovane JSON logovani s job_id - vsechny limity vypnute ve vychozim stavu Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium a fonty s ceskou diakritikou. Autentizace zamerne neni implementovana, zpusob predavani neni domluveny. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
40 lines
1.2 KiB
Python
40 lines
1.2 KiB
Python
"""Measurement fixture for a document of roughly twelve hundred pages.
|
|
|
|
Marked slow on purpose. It is here to measure memory and wall clock time of the
|
|
chunked pipeline, not to assert exact numbers.
|
|
"""
|
|
|
|
from __future__ import annotations
|
|
|
|
import time
|
|
|
|
import pytest
|
|
|
|
pytest.importorskip("weasyprint")
|
|
|
|
from app.config import Settings # noqa: E402
|
|
from app.engines.weasy import WeasyPrintEngine # noqa: E402
|
|
from app.models import ChunkSettings, ConvertRequest, PageNumbers, Source # noqa: E402
|
|
from app.services.pipeline import ConversionPipeline # noqa: E402
|
|
|
|
pytestmark = [pytest.mark.asyncio, pytest.mark.slow]
|
|
|
|
|
|
async def test_large_document_renders_in_chunks(tmp_path, large_document: str) -> None:
|
|
pipeline = ConversionPipeline({"weasyprint": WeasyPrintEngine()}, Settings())
|
|
request = ConvertRequest(
|
|
source=Source(html=large_document),
|
|
engine="weasyprint",
|
|
page_numbers=PageNumbers(enabled=True),
|
|
chunking=ChunkSettings(enabled=True, pages_per_chunk=50),
|
|
)
|
|
|
|
started = time.monotonic()
|
|
result = await pipeline.run(request, tmp_path)
|
|
duration = time.monotonic() - started
|
|
|
|
print(f"stranek: {result.page_count}, cas: {duration:.1f} s")
|
|
|
|
assert result.page_count > 1000
|
|
assert result.path.exists()
|