RAG-pipelines är bara så bra som de data de hämtar, och de data är bara så bra som dokumentparsningen före chunking och embeddingar.
Att mata rå PDF-text till en vektordatabas förstör ofta sökkvaliteten: PDF:er består av positionerade glyfer, inte semantiska stycken, rubriker eller tabeller.
Pipelinen
- Dokument → Markdown — konvertera PDF, DOCX och PPTX via AnyMD.
- Markdown → Chunks — dela på rubriker och stycken.
- Chunks → Embeddingar — kör varje del genom modellen.
- Embeddingar → Vektorlager — indexera för likhetssökning.
Markdown bevarar rubriker, listor, tabeller och kodblock. Det gör semantisk chunking och embeddingar bättre än blankstegsutfylld PDF-text.
# Convert a quarterly report to Markdown
curl -X POST https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@quarterly-report.pdf" \
-o report.mdAnyMD konverterar en 48-sidig rapport på under en sekund. Vid 10 000 dokument per dag betyder det 2,2 timmar i stället för 16–39 timmar med Python-alternativ.