Pracując z AI/ML, prawdopodobnie masz w zbiorach danych wiele formatów: artykuły PDF, manuskrypty DOCX, prezentacje PPTX, arkusze XLSX i ebooki EPUB. Zanim użyjesz ich do treningu, fine-tuningu lub RAG, trzeba je ujednolicić do czystego, ustrukturyzowanego tekstu.
Ten wpis pokazuje, jak używać AnyMD z linii poleceń i Pythona, aby zamienić każdy format dokumentu w Markdown w jednym kroku — bez parserów specyficznych dla formatu, obejść i ręcznego czyszczenia.
Z linii poleceń
Najprostsze użycie — konwersja jednego pliku:
curl https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@paper.pdf"
To wszystko. AnyMD automatycznie wykrywa format na podstawie rozszerzenia. Ta sama komenda działa dla DOCX, PPTX, XLSX, RTF, EPUB, ODT, HTML, CSV i innych.
Przekieruj wynik do pliku:
curl -s https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@research-paper.pdf" \
-o research-paper.md
Z Pythona
import requests
with open("report.pdf", "rb") as f:
resp = requests.post(
"https://anymd.net/api/convert",
headers={"Authorization": "Bearer your-key"},
files={"file": ("report.pdf", f)},
)
markdown = resp.text
print(markdown[:500])
Konwersja wsadowa przy przygotowaniu danych treningowych
import requests
from pathlib import Path
markdown_dir = Path("training_data_md")
markdown_dir.mkdir(exist_ok=True)
for doc in Path("raw_documents").glob("*"):
if doc.suffix not in {".pdf", ".docx", ".pptx", ".xlsx", ".epub"}:
continue
with open(doc, "rb") as f:
resp = requests.post(
"https://anymd.net/api/convert",
headers={"Authorization": "Bearer your-key"},
files={"file": (doc.name, f)},
)
if resp.ok:
out = markdown_dir / f"{doc.stem}.md"
out.write_text(resp.text)
print(f"✓ {doc.name} → {out.name}")
else:
print(f"✗ {doc.name}: {resp.status_code}")
To cały kod potrzebny, aby ujednolicić bibliotekę dokumentów o mieszanych formatach do czystego, spójnego Markdown — gotowego do dzielenia, embeddingów lub fine-tuningu.
Dlaczego nie biblioteki dla pojedynczych formatów?
Większość projektów zaczyna od PyMuPDF dla PDF, python-pptx dla PowerPointa, python-docx dla Worda, openpyxl dla Excela i ebooklib dla EPUB. To pięć bibliotek, pięć API, pięć formatów wyjściowych i pięć kosztów utrzymania.
AnyMD to jedno API, jeden format wyjściowy (GFM Markdown) i jeden klucz uwierzytelniający. Bez zarządzania bibliotekami, konfliktów wersji i przypadków brzegowych formatów do debugowania.
Pobierz darmowy klucz API — 100 stron/miesiąc, bez karty.