Blog

Convierte documentos a Markdown desde CLI o Python

10 de agosto de 2026 · 4 min de lectura


Si trabajas con IA/ML, probablemente tienes PDF, manuscritos DOCX, presentaciones PPTX, hojas XLSX y libros EPUB dispersos por tus conjuntos de datos. Antes de usarlos para entrenamiento, fine-tuning o RAG, hay que normalizarlos a texto limpio y estructurado.

Esta guía muestra cómo usar AnyMD desde la línea de comandos y Python para convertir cualquier documento a Markdown en un paso: sin analizadores específicos por formato, sin alternativas y sin limpieza posterior.

Desde la línea de comandos

El uso más simple convierte un archivo:

curl https://anymd.net/api/convert \
  -H "Authorization: Bearer your-key" \
  -F "file=@paper.pdf"

Eso es todo. AnyMD detecta automáticamente el formato por la extensión. El mismo comando funciona con DOCX, PPTX, XLSX, RTF, EPUB, ODT, HTML, CSV y más.

Para guardar la salida:

curl -s https://anymd.net/api/convert \
  -H "Authorization: Bearer your-key" \
  -F "file=@research-paper.pdf" \
  -o research-paper.md

Desde Python

import requests

with open("report.pdf", "rb") as f:
    resp = requests.post(
        "https://anymd.net/api/convert",
        headers={"Authorization": "Bearer your-key"},
        files={"file": ("report.pdf", f)},
    )
    markdown = resp.text
    print(markdown[:500])

Conversión por lotes para preparar datos de entrenamiento

import requests
from pathlib import Path

markdown_dir = Path("training_data_md")
markdown_dir.mkdir(exist_ok=True)

for doc in Path("raw_documents").glob("*"):
    if doc.suffix not in {".pdf", ".docx", ".pptx", ".xlsx", ".epub"}:
        continue
    with open(doc, "rb") as f:
        resp = requests.post(
            "https://anymd.net/api/convert",
            headers={"Authorization": "Bearer your-key"},
            files={"file": (doc.name, f)},
        )
        if resp.ok:
            out = markdown_dir / f"{doc.stem}.md"
            out.write_text(resp.text)
            print(f"✓ {doc.name} → {out.name}")
        else:
            print(f"✗ {doc.name}: {resp.status_code}")

Con esto basta para normalizar una biblioteca de formatos mezclados a Markdown consistente, listo para fragmentar, generar embeddings o hacer fine-tuning.

¿Por qué no usar bibliotecas específicas?

La mayoría de proyectos usan PyMuPDF para PDF, python-pptx para PowerPoint, python-docx para Word, openpyxl para Excel y ebooklib para EPUB. Son cinco bibliotecas, cinco APIs, cinco formatos de salida y cinco cargas de mantenimiento.

AnyMD es una API, un formato de salida (Markdown GFM) y una clave de autenticación. Sin gestión de bibliotecas, conflictos de versiones ni casos límite por formato que depurar.

Obtén tu clave API gratuita — 100 páginas/mes, sin tarjeta.


← Leer más →