Blog

Konwertuj dokumenty do Markdown z CLI lub Pythona

10 sierpnia 2026 · 4 min czytania


Pracując z AI/ML, prawdopodobnie masz w zbiorach danych wiele formatów: artykuły PDF, manuskrypty DOCX, prezentacje PPTX, arkusze XLSX i ebooki EPUB. Zanim użyjesz ich do treningu, fine-tuningu lub RAG, trzeba je ujednolicić do czystego, ustrukturyzowanego tekstu.

Ten wpis pokazuje, jak używać AnyMD z linii poleceń i Pythona, aby zamienić każdy format dokumentu w Markdown w jednym kroku — bez parserów specyficznych dla formatu, obejść i ręcznego czyszczenia.

Z linii poleceń

Najprostsze użycie — konwersja jednego pliku:

curl https://anymd.net/api/convert \
  -H "Authorization: Bearer your-key" \
  -F "file=@paper.pdf"

To wszystko. AnyMD automatycznie wykrywa format na podstawie rozszerzenia. Ta sama komenda działa dla DOCX, PPTX, XLSX, RTF, EPUB, ODT, HTML, CSV i innych.

Przekieruj wynik do pliku:

curl -s https://anymd.net/api/convert \
  -H "Authorization: Bearer your-key" \
  -F "file=@research-paper.pdf" \
  -o research-paper.md

Z Pythona

import requests

with open("report.pdf", "rb") as f:
    resp = requests.post(
        "https://anymd.net/api/convert",
        headers={"Authorization": "Bearer your-key"},
        files={"file": ("report.pdf", f)},
    )
    markdown = resp.text
    print(markdown[:500])

Konwersja wsadowa przy przygotowaniu danych treningowych

import requests
from pathlib import Path

markdown_dir = Path("training_data_md")
markdown_dir.mkdir(exist_ok=True)

for doc in Path("raw_documents").glob("*"):
    if doc.suffix not in {".pdf", ".docx", ".pptx", ".xlsx", ".epub"}:
        continue
    with open(doc, "rb") as f:
        resp = requests.post(
            "https://anymd.net/api/convert",
            headers={"Authorization": "Bearer your-key"},
            files={"file": (doc.name, f)},
        )
        if resp.ok:
            out = markdown_dir / f"{doc.stem}.md"
            out.write_text(resp.text)
            print(f"✓ {doc.name} → {out.name}")
        else:
            print(f"✗ {doc.name}: {resp.status_code}")

To cały kod potrzebny, aby ujednolicić bibliotekę dokumentów o mieszanych formatach do czystego, spójnego Markdown — gotowego do dzielenia, embeddingów lub fine-tuningu.

Dlaczego nie biblioteki dla pojedynczych formatów?

Większość projektów zaczyna od PyMuPDF dla PDF, python-pptx dla PowerPointa, python-docx dla Worda, openpyxl dla Excela i ebooklib dla EPUB. To pięć bibliotek, pięć API, pięć formatów wyjściowych i pięć kosztów utrzymania.

AnyMD to jedno API, jeden format wyjściowy (GFM Markdown) i jeden klucz uwierzytelniający. Bez zarządzania bibliotekami, konfliktów wersji i przypadków brzegowych formatów do debugowania.

Pobierz darmowy klucz API — 100 stron/miesiąc, bez karty.


← Czytaj dalej →