En RAG-pipeline er bare så god som dataene den henter frem. Kvaliteten avhenger først av dokumentparsingen som mater oppdeling og embeddings.
Å legge rå PDF-tekst i en vektordatabase er en vanlig feil. PDF-er inneholder plasserte glyfer, ikke semantiske avsnitt, tabeller og overskrifter. Markdown bevarer derimot dokumentstrukturen.
Pipelinen
- Dokument → Markdown — konverter PDF, DOCX eller PPTX med AnyMD.
- Markdown → deler — del ved overskrifter og avsnitt.
- Deler → embeddings — send hver del til embeddingmodellen.
- Embeddings → vektorlager — indekser for likhetssøk.
Praktisk eksempel
curl -X POST https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@quarterly-report.pdf" \
-o report.mdMarkdown-utdataene beholder overskrifter, tabeller, lister og avsnitt, klare for LangChain, LlamaIndex eller din egen pipeline.
Skala
AnyMD konverterer en rapport på 48 sider på under et sekund. Ved 10 000 dokumenter om dagen er konverteringsforsinkelse en reell flaskehals, ikke en detalj.