Blog

Construirea unui pipeline de ingestie RAG care chiar funcționează

10 august 2026 · 5 min de citit


Pipeline-urile RAG (Retrieval-Augmented Generation) sunt la fel de bune ca datele pe care le recuperează. Iar acele date sunt la fel de bune ca parsarea documentelor care alimentează chunker-ul și embedder-ul.

Greșeala obișnuită este să trimiți text PDF brut într-o bază de date vectorială și să te întrebi de ce recuperarea e slabă. PDF-urile nu conțin text structurat, ci glife poziționate: paragrafele sunt blocuri fără grupare semantică, tabelele sunt coordonate, iar titlurile sunt text mai mare și îngroșat.

Pipeline-ul

  1. Document → Markdown — Convertește PDF, DOCX, PPTX sau orice format în Markdown curat și structurat cu API-ul AnyMD.
  2. Markdown → Chunk-uri — Împarte după titluri și paragrafe, semantic, nu după o lungime fixă de token-uri.
  3. Chunk-uri → Embedding-uri — Trimite fiecare chunk prin modelul de embedding.
  4. Embedding-uri → Vector store — Indexează pentru căutare de similaritate.

Pasul 1 este locul unde multe pipeline-uri RAG eșuează în tăcere: date proaste la intrare, rezultate proaste la ieșire.

De ce Markdown este cel mai bun format intermediar

Markdown păstrează titluri, liste, tabele și blocuri de cod într-un format ușor pe care chunkerele și modelele de embedding îl înțeleg nativ.

Text PDF brut:

Revenue Q1 Q2 Q3
EU €1.2M €1.4M €1.1M
US €0.9M €1.1M €1.3M

După conversia AnyMD:

| Region | Q1    | Q2    | Q3    |
| :----- | :---- | :---- | :---- |
| EU     | €1.2M | €1.4M | €1.1M |
| US     | €0.9M | €1.1M | €1.3M |

Versiunea Markdown are sens semantic. Un chunker poate împărți la limitele titlurilor, iar un model de embedding generează vectori mai buni pentru un tabel. La întrebarea „care a fost venitul UE în T2?”, este recuperat tabelul real cu antete de coloană, nu numere izolate.

Exemplu practic

# Convert a quarterly report to Markdown
curl -X POST https://anymd.net/api/convert \
  -H "Authorization: Bearer your-key" \
  -F "file=@quarterly-report.pdf" \
  -o report.md

Ieșirea Markdown păstrează fiecare titlu, tabel, listă și paragraf, gata pentru orice framework RAG, cum ar fi LangChain sau LlamaIndex.

Performanța la scară

AnyMD convertește un raport de 48 de pagini sub o secundă. Pentru 10.000 de documente pe zi, aceasta înseamnă 2,2 ore cu AnyMD versus 16–39 ore cu alternative Python: latența conversiei devine un blocaj de debit.


← Citește mai mult →