Wenn du mit KI/ML arbeitest, hast du wahrscheinlich eine Mischung aus Dokumentformaten in deinen Datensätzen: PDF-Forschungsarbeiten, DOCX-Manuskripte, PPTX-Präsentationen, XLSX-Tabellen und EPUB-E-Books. Bevor du sie fürs Training, Fine-Tuning oder RAG verwenden kannst, müssen sie in sauberen, strukturierten Text vereinheitlicht werden.
Dieser Beitrag zeigt, wie du AnyMD über die Kommandozeile und Python verwendest, um jedes Dokumentformat in einem Schritt in Markdown umzuwandeln — keine formatspezifischen Parser, keine Fallbacks, keine Nacharbeit.
Über die Kommandozeile
Die einfachste Nutzung: eine einzelne Datei umwandeln:
curl https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@paper.pdf"
Das ist alles. AnyMD erkennt das Format automatisch anhand der Dateiendung. Derselbe Befehl funktioniert für DOCX, PPTX, XLSX, RTF, EPUB, ODT, HTML, CSV und mehr.
Leite die Ausgabe in eine Datei:
curl -s https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@research-paper.pdf" \
-o research-paper.md
Über Python
import requests
with open("report.pdf", "rb") as f:
resp = requests.post(
"https://anymd.net/api/convert",
headers={"Authorization": "Bearer your-key"},
files={"file": ("report.pdf", f)},
)
markdown = resp.text
print(markdown[:500])
Stapelkonvertierung für die Vorbereitung von Trainingsdaten
import requests
from pathlib import Path
markdown_dir = Path("training_data_md")
markdown_dir.mkdir(exist_ok=True)
for doc in Path("raw_documents").glob("*"):
if doc.suffix not in {".pdf", ".docx", ".pptx", ".xlsx", ".epub"}:
continue
with open(doc, "rb") as f:
resp = requests.post(
"https://anymd.net/api/convert",
headers={"Authorization": "Bearer your-key"},
files={"file": (doc.name, f)},
)
if resp.ok:
out = markdown_dir / f"{doc.stem}.md"
out.write_text(resp.text)
print(f"✓ {doc.name} → {out.name}")
else:
print(f"✗ {doc.name}: {resp.status_code}")
Das ist der gesamte Code, den du brauchst, um eine Dokumentbibliothek mit gemischten Formaten in sauberes, einheitliches Markdown zu überführen — bereit für Chunking, Embeddings oder Fine-Tuning.
Warum keine formatspezifischen Bibliotheken?
Die meisten Projekte beginnen mit PyMuPDF für PDFs, python-pptx für PowerPoint, python-docx für Word, openpyxl für Excel und ebooklib für EPUBs. Das sind fünf unterschiedliche Bibliotheken mit fünf unterschiedlichen APIs, fünf unterschiedlichen Ausgabeformaten und fünf unterschiedlichen Wartungsaufwänden.
AnyMD ist eine API, ein Ausgabeformat (GFM Markdown) und ein Authentifizierungsschlüssel. Keine Bibliotheksverwaltung, keine Versionskonflikte, keine formatspezifischen Sonderfälle zum Debuggen.
Hol dir deinen kostenlosen API-Schlüssel — 100 Seiten/Monat, keine Karte erforderlich.