RAG-pipelines er kun så gode som de data, de henter. Rå PDF-tekst er ofte årsagen til dårlig søgekvalitet: PDF'er indeholder placerede glyffer, ikke semantiske afsnit, overskrifter og tabeller.
Pipelinen
- Dokument → Markdown — konvertér PDF, DOCX eller PPTX med AnyMD.
- Markdown → Chunks — del efter overskrifter og afsnit.
- Chunks → Embeddings — kør hver del gennem embedding-modellen.
- Embeddings → Vektorlager — indeksér til lighedssøgning.
Markdown bevarer overskrifter, lister, tabeller og kodeblokke og gør semantisk chunking bedre end rå PDF-tekst.
curl -X POST https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@quarterly-report.pdf" \
-o report.mdEn 48-siders rapport tager under et sekund med AnyMD. Ved 10.000 dokumenter om dagen er det 2,2 timer i stedet for 16–39 timer med Python-alternativer.