Blog

Convertir des documents en Markdown depuis la CLI ou Python

10 août 2026 · 4 min de lecture


Si vous travaillez en IA/ML, vos jeux de données contiennent sans doute un mélange de formats : articles de recherche PDF, manuscrits DOCX, présentations PPTX, feuilles XLSX, ebooks EPUB. Avant de pouvoir les utiliser pour l’entraînement, le fine-tuning ou RAG, il faut les normaliser en texte propre et structuré.

Cet article montre comment utiliser AnyMD depuis la ligne de commande et Python pour convertir n’importe quel format de document en Markdown en une étape — sans analyseur propre à chaque format, sans solution de repli, sans nettoyage.

Depuis la ligne de commande

L’utilisation la plus simple : convertir un seul fichier.

curl https://anymd.net/api/convert \
  -H "Authorization: Bearer your-key" \
  -F "file=@paper.pdf"

C’est tout. AnyMD détecte automatiquement le format à partir de l’extension. La même commande fonctionne pour DOCX, PPTX, XLSX, RTF, EPUB, ODT, HTML, CSV et bien d’autres.

Envoyez la sortie dans un fichier :

curl -s https://anymd.net/api/convert \
  -H "Authorization: Bearer your-key" \
  -F "file=@research-paper.pdf" \
  -o research-paper.md

Depuis Python

import requests

with open("report.pdf", "rb") as f:
    resp = requests.post(
        "https://anymd.net/api/convert",
        headers={"Authorization": "Bearer your-key"},
        files={"file": ("report.pdf", f)},
    )
    markdown = resp.text
    print(markdown[:500])

Conversion par lots pour préparer des données d’entraînement

import requests
from pathlib import Path

markdown_dir = Path("training_data_md")
markdown_dir.mkdir(exist_ok=True)

for doc in Path("raw_documents").glob("*"):
    if doc.suffix not in {".pdf", ".docx", ".pptx", ".xlsx", ".epub"}:
        continue
    with open(doc, "rb") as f:
        resp = requests.post(
            "https://anymd.net/api/convert",
            headers={"Authorization": "Bearer your-key"},
            files={"file": (doc.name, f)},
        )
        if resp.ok:
            out = markdown_dir / f"{doc.stem}.md"
            out.write_text(resp.text)
            print(f"✓ {doc.name} → {out.name}")
        else:
            print(f"✗ {doc.name}: {resp.status_code}")

C’est tout le code nécessaire pour normaliser une bibliothèque de documents aux formats mixtes en Markdown propre et cohérent — prêt pour le découpage, les embeddings ou le fine-tuning.

Pourquoi ne pas utiliser de bibliothèques propres à chaque format ?

La plupart des projets commencent avec PyMuPDF pour les PDF, python-pptx pour PowerPoint, python-docx pour Word, openpyxl pour Excel et ebooklib pour les EPUB. Cela fait cinq bibliothèques, cinq API différentes, cinq formats de sortie et cinq charges de maintenance.

AnyMD, c’est une API, un format de sortie (GFM Markdown) et une clé d’authentification. Pas de gestion de bibliothèques, pas de conflits de versions, pas de cas particuliers spécifiques aux formats à déboguer.

Obtenez votre clé API gratuite — 100 pages/mois, sans carte bancaire.


← Lire la suite →