Blog

Creare una pipeline di ingestione RAG che funziona davvero

10 agosto 2026 · 5 min di lettura


Le pipeline RAG (Retrieval-Augmented Generation) sono valide quanto i dati che recuperano. E quei dati dipendono dal parsing dei documenti che alimenta chunker ed embedder.

L'errore più comune è inserire testo PDF grezzo in un database vettoriale e chiedersi perché la qualità del recupero sia bassa. I PDF non contengono testo strutturato, ma glifi posizionati. I paragrafi sono blocchi senza raggruppamento semantico, le tabelle coordinate e i titoli testo più grande in grassetto.

La pipeline

  1. Documento → Markdown — Converti PDF, DOCX, PPTX o qualunque altro formato in Markdown pulito e strutturato con l'API di AnyMD.
  2. Markdown → Chunk — Dividi per titoli e paragrafi, con chunking semantico.
  3. Chunk → Embedding — Passa ogni chunk al modello di embedding.
  4. Embedding → Archivio vettoriale — Indicizza per la ricerca di similarità.

Il primo passaggio è dove molte pipeline RAG falliscono silenziosamente: spazzatura in ingresso, spazzatura in uscita.

Perché Markdown è il miglior formato intermedio

Markdown conserva titoli, elenchi, tabelle e blocchi di codice in un formato leggero che chunker e modelli di embedding comprendono nativamente.

Testo PDF grezzo:

Revenue Q1 Q2 Q3
EU €1.2M €1.4M €1.1M
US €0.9M €1.1M €1.3M

Dopo la conversione AnyMD:

| Region | Q1    | Q2    | Q3    |
| :----- | :---- | :---- | :---- |
| EU     | €1.2M | €1.4M | €1.1M |
| US     | €0.9M | €1.1M | €1.3M |

La versione Markdown ha significato semantico. Un chunker può dividere ai confini dei titoli e un modello di embedding produce vettori migliori per una tabella. Per la domanda «quali erano i ricavi UE nel Q2?», viene recuperata la tabella effettiva con le intestazioni, non numeri orfani.

Esempio pratico

# Convert a quarterly report to Markdown
curl -X POST https://anymd.net/api/convert \
  -H "Authorization: Bearer your-key" \
  -F "file=@quarterly-report.pdf" \
  -o report.md

L'output Markdown conserva ogni titolo, tabella, elenco e paragrafo, pronto per qualunque framework RAG (LangChain, LlamaIndex o il tuo).

Le prestazioni contano su scala

AnyMD converte un report di 48 pagine in meno di un secondo. Per 10.000 documenti al giorno, è la differenza tra 2,2 ore con AnyMD e 16–39 ore con alternative Python: la latenza di conversione è un collo di bottiglia della produttività.


← Leggi di più →