Implementace prevodu HTML na PDF
Sluzba prijme adresu HTML dokumentu nebo HTML v tele requestu a vrati PDF. Navrzena pro dokumenty o stovkach az tisicich stranek. Rendering: - WeasyPrint jako vychozi engine, spravne CSS Paged Media, nizka pametova narocnost, bez JavaScriptu - Chromium pres Playwright pro dokumenty dokreslovane skripty - rezim auto s detekci skriptu a fallbackem pri selhani WeasyPrintu Velke dokumenty: - deleni na casti na strukturalnich hranicich, rez nikdy uvnitr tabulky nebo odstavce - dvoupruchodovy render obsahu se skutecnymi cisly stranek, pozice nadpisu se ctou z kotev hlasenych u kazde stranky - cislovani stranek bud pres CSS countery, nebo pres cislovaci vrstvu nastampovanou na hotove PDF, rozmer stranky se cte z vysledneho souboru - Chromium se restartuje po N jobech, nikdy vsak behem beziciho renderu API: - POST /convert synchronne, POST /jobs asynchronne se sledovanim stavu, stahovanim vysledku, rusenim a volitelnym callbackem - GET /health s overenim dostupnosti obou enginu a stavem fronty - OpenAPI respektuje prefix reverse proxy pres root_path Bezpecnost a provoz: - SSRF kontrola po DNS resolvu, na kazdem presmerovani a u vsech pozadavku prohlizece - nedostupne assety render nezastavi, ale hlasi se v odpovedi i v logu - fronta s omezenym poctem workeru, rozpracovane joby se pri ukonceni oznaci jako failed, nezmizi potichu - strukturovane JSON logovani s job_id - vsechny limity vypnute ve vychozim stavu Dockerfile je dvoufazovy, obsahuje zavislosti WeasyPrintu, Chromium a fonty s ceskou diakritikou. Autentizace zamerne neni implementovana, zpusob predavani neni domluveny. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 5
parent
e3cc8f418b
commit
156289fe2d
@@ -0,0 +1,90 @@
|
||||
"""Asynchronous conversion. This is the path for large documents."""
|
||||
|
||||
from __future__ import annotations
|
||||
|
||||
import logging
|
||||
|
||||
from fastapi import APIRouter, Response, status
|
||||
from fastapi.responses import FileResponse
|
||||
|
||||
from ..deps import get_container
|
||||
from ..errors import ConversionError, JobNotFoundError
|
||||
from ..models import ConvertRequest, JobAccepted, JobState
|
||||
|
||||
logger = logging.getLogger(__name__)
|
||||
|
||||
router = APIRouter(prefix="/jobs", tags=["joby"])
|
||||
|
||||
|
||||
def _result_url(job_id: str) -> str:
|
||||
root = get_container().settings.root_path.rstrip("/")
|
||||
return f"{root}/jobs/{job_id}/result"
|
||||
|
||||
|
||||
@router.post(
|
||||
"",
|
||||
response_model=JobAccepted,
|
||||
status_code=status.HTTP_202_ACCEPTED,
|
||||
summary="Zaradi konverzi do fronty",
|
||||
)
|
||||
async def create_job(request: ConvertRequest) -> JobAccepted:
|
||||
job = get_container().jobs.submit(request)
|
||||
return JobAccepted(
|
||||
job_id=job.id,
|
||||
status=job.state.status,
|
||||
created_at=job.state.created_at,
|
||||
result_url=_result_url(job.id),
|
||||
)
|
||||
|
||||
|
||||
@router.get("/{job_id}", response_model=JobState, summary="Stav jobu")
|
||||
async def job_state(job_id: str) -> JobState:
|
||||
job = get_container().jobs.get(job_id)
|
||||
state = job.state.model_copy()
|
||||
if state.status == "done":
|
||||
state.result_url = _result_url(job_id)
|
||||
return state
|
||||
|
||||
|
||||
@router.get(
|
||||
"/{job_id}/result",
|
||||
summary="Stahne hotove PDF",
|
||||
response_class=Response,
|
||||
responses={
|
||||
200: {"content": {"application/pdf": {}}, "description": "Hotove PDF."},
|
||||
404: {"description": "Job neexistuje nebo uz expiroval."},
|
||||
409: {"description": "Job jeste nedobehl nebo skoncil chybou."},
|
||||
},
|
||||
)
|
||||
async def job_result(job_id: str):
|
||||
container = get_container()
|
||||
job = container.jobs.get(job_id)
|
||||
|
||||
if job.state.status != "done":
|
||||
error = ConversionError(
|
||||
f"Vysledek neni k dispozici, job je ve stavu {job.state.status}.",
|
||||
{"status": job.state.status},
|
||||
)
|
||||
error.error_code = "result_not_ready"
|
||||
error.status_code = 409
|
||||
raise error
|
||||
|
||||
path = container.storage.result_path(job_id)
|
||||
if not path.exists():
|
||||
raise JobNotFoundError("Soubor s vysledkem uz neexistuje, job pravdepodobne expiroval.")
|
||||
|
||||
filename = job.request.filename or "dokument.pdf"
|
||||
return FileResponse(
|
||||
path,
|
||||
media_type="application/pdf",
|
||||
filename=filename,
|
||||
headers={
|
||||
"X-Page-Count": str(job.state.page_count or 0),
|
||||
"X-Engine-Used": job.state.engine_used or "",
|
||||
},
|
||||
)
|
||||
|
||||
|
||||
@router.delete("/{job_id}", response_model=JobState, summary="Zrusi job nebo smaze jeho vysledek")
|
||||
async def delete_job(job_id: str) -> JobState:
|
||||
return get_container().jobs.cancel(job_id).state
|
||||
Reference in New Issue
Block a user