Blog

Byg en RAG-ingestionspipeline, der faktisk virker

10. august 2026 · 5 min. læsning


RAG-pipelines er kun så gode som de data, de henter. Rå PDF-tekst er ofte årsagen til dårlig søgekvalitet: PDF'er indeholder placerede glyffer, ikke semantiske afsnit, overskrifter og tabeller.

Pipelinen

  1. Dokument → Markdown — konvertér PDF, DOCX eller PPTX med AnyMD.
  2. Markdown → Chunks — del efter overskrifter og afsnit.
  3. Chunks → Embeddings — kør hver del gennem embedding-modellen.
  4. Embeddings → Vektorlager — indeksér til lighedssøgning.

Markdown bevarer overskrifter, lister, tabeller og kodeblokke og gør semantisk chunking bedre end rå PDF-tekst.

curl -X POST https://anymd.net/api/convert \
  -H "Authorization: Bearer your-key" \
  -F "file=@quarterly-report.pdf" \
  -o report.md

En 48-siders rapport tager under et sekund med AnyMD. Ved 10.000 dokumenter om dagen er det 2,2 timer i stedet for 16–39 timer med Python-alternativer.


← Læs mere →