RAG-Pipelines (Retrieval-Augmented Generation) sind nur so gut wie die Daten, die sie abrufen. Und diese Daten sind nur so gut wie der Dokument-Parsing-Schritt, der Chunker und Embedder versorgt.
Der häufigste Fehler, den wir sehen: rohen PDF-Text in eine Vektordatenbank geben und sich dann über schlechte Retrieval-Qualität wundern. PDFs enthalten keinen strukturierten Text — sie enthalten positionierte Glyphen. Ein „Absatz“ in einem PDF ist eine lose Sammlung von Textblöcken ohne semantische Gruppierung. Tabellen sind keine Tabellen, sondern Koordinaten. Überschriften sind keine Überschriften, sondern fetter Text in größerer Schrift.
Die Pipeline
- Dokument → Markdown — Wandle PDF, DOCX, PPTX oder ein anderes Format mit der AnyMD-API in sauberes, strukturiertes Markdown um.
- Markdown → Chunks — Teile nach Überschriften und Absätzen auf (semantisches Chunking statt Token-Aufteilung fester Länge).
- Chunks → Embeddings — Schicke jeden Chunk durch dein Embedding-Modell.
- Embeddings → Vector Store — Indexiere für Ähnlichkeitssuche.
Schritt 1 ist der Punkt, an dem die meisten RAG-Pipelines stillscheigend scheitern. Schlechte Daten rein, schlechte Ergebnisse raus.
Warum Markdown das beste Zwischenformat ist
Markdown bewahrt die Dokumentstruktur — Überschriften, Listen, Tabellen, Codeblöcke — in einem leichtgewichtigen Format, das Chunker und Embedding-Modelle nativ verstehen. Vergleiche diese zwei Darstellungen derselben Daten:
Roher PDF-Text:
Revenue Q1 Q2 Q3
EU €1.2M €1.4M €1.1M
US €0.9M €1.1M €1.3M
Nach der AnyMD-Konvertierung:
| Region | Q1 | Q2 | Q3 |
| :----- | :---- | :---- | :---- |
| EU | €1.2M | €1.4M | €1.1M |
| US | €0.9M | €1.1M | €1.3M |
Die Markdown-Version ist semantisch aussagekräftig. Ein semantischer Chunker kann an Überschriften-Grenzen teilen. Ein Embedding-Modell erzeugt bessere Vektoren für eine Tabelle als für einen Textblock mit Leerzeichen. Und wenn ein Nutzer fragt „Wie hoch war der EU-Umsatz in Q2?“, enthält der abgerufene Chunk die tatsächliche Tabelle mit Spaltenüberschriften, nicht verwaiste Zahlen.
Praktisches Beispiel
# Convert a quarterly report to Markdown
curl -X POST https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@quarterly-report.pdf" \
-o report.md
# Now feed that Markdown into your chunker/embedder pipeline
Die Markdown-Ausgabe bewahrt jede Überschrift, Tabelle, Liste und jeden Absatz — bereit für die Aufnahme in jedes RAG-Framework (LangChain, LlamaIndex oder dein eigenes).
Leistung zählt im großen Maßstab
AnyMD wandelt einen 48-seitigen Bericht in unter einer Sekunde um. Wenn deine Pipeline 10.000 Dokumente pro Tag verarbeitet, ist das der Unterschied zwischen 2,2 Stunden Konvertierungszeit (AnyMD) und 16–39 Stunden (Python-basierte Alternativen). Im Maßstab einer RAG-Pipeline ist Konvertierungslatenz kein Detail — sie ist ein Durchsatzengpass.