AI/ML-data innehåller ofta PDF, DOCX, PPTX, XLSX och EPUB. Före träning, fine-tuning eller RAG behöver de normaliseras till ren strukturerad text.
Från kommandoraden
curl https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@paper.pdf"AnyMD känner igen formatet från filändelsen och samma kommando fungerar för DOCX, PPTX, XLSX, RTF, EPUB, ODT, HTML och CSV.
Från Python
import requests
with open("report.pdf", "rb") as f:
resp = requests.post("https://anymd.net/api/convert", headers={"Authorization": "Bearer your-key"}, files={"file": ("report.pdf", f)})
markdown = resp.textFör batchar loopar du över dokument och sparar varje lyckat svar som .md. Ett API, ett utdataformat (GFM Markdown) och en nyckel ersätter många formatspecifika bibliotek och deras underhåll.
Hämta gratis API-nyckel — 100 sidor/månad.