AI- og ML-datasett inneholder ofte PDF-er, DOCX-manuskripter, PPTX-presentasjoner, XLSX-regneark og EPUB-er. Før trening, finjustering eller RAG må de normaliseres til ren, strukturert tekst.
Fra kommandolinjen
curl https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@paper.pdf"AnyMD oppdager formatet fra filendelsen. Samme kommando fungerer for DOCX, PPTX, XLSX, RTF, EPUB, ODT, HTML og CSV.
Fra Python
import requests
with open("report.pdf", "rb") as f:
resp = requests.post("https://anymd.net/api/convert",
headers={"Authorization": "Bearer your-key"},
files={"file": ("report.pdf", f)})
markdown = resp.text
Hvorfor ett API?
Formatspesifikke biblioteker gir forskjellige API-er, utdata og vedlikeholdsbyrde. AnyMD gir ett API, én autentiseringsnøkkel og ett utdataformat: GFM Markdown.
Hent gratis API-nøkkel → 100 sider per måned, uten kort.