RAG-putket ovat vain niin hyviä kuin niiden hakema data. Data taas riippuu asiakirjajäsennyksestä, joka syöttää chunkerin ja embedding-mallin.
Yleisin virhe on lähettää raakaa PDF-tekstiä vektoritietokantaan ja ihmetellä heikkoa hakua. PDF ei sisällä rakenteista tekstiä vaan sijoitettuja glyyfejä: kappaleet ovat irrallisia lohkoja, taulukot koordinaatteja ja otsikot suurempaa lihavoitua tekstiä.
Putki
- Asiakirja → Markdown — Muunna PDF, DOCX, PPTX tai muu muoto siistiksi, rakenteiseksi Markdowniksi AnyMD:llä.
- Markdown → Chunkit — Jaa otsikoiden ja kappaleiden mukaan semanttisesti.
- Chunkit → Embeddingit — Syötä jokainen chunk embedding-mallille.
- Embeddingit → Vektorivarasto — Indeksoi samankaltaisuushakua varten.
Ensimmäisessä vaiheessa moni RAG-putki epäonnistuu hiljaisesti: roskaa sisään, roskaa ulos.
Miksi Markdown on paras väliformaatti
Markdown säilyttää otsikot, luettelot, taulukot ja koodilohkot kevyessä muodossa, jonka chunkerit ja embedding-mallit ymmärtävät.
| Region | Q1 | Q2 | Q3 |
| :----- | :---- | :---- | :---- |
| EU | €1.2M | €1.4M | €1.1M |
| US | €0.9M | €1.1M | €1.3M |Markdown-versio on semanttisesti merkityksellinen: chunker voi jakaa otsikkorajoilla ja kysymys EU:n Q2-liikevaihdosta hakee oikean taulukon otsikkoineen, ei irrallisia numeroita.
AnyMD muuntaa 48-sivuisen raportin alle sekunnissa. 10 000 asiakirjan päivävauhdilla se on 2,2 tuntia AnyMD:llä verrattuna Python-vaihtoehtojen 16–39 tuntiin.