Jos työskentelet AI:n tai ML:n parissa, aineistoissasi on todennäköisesti PDF-tutkimuksia, DOCX-käsikirjoituksia, PPTX-esityksiä, XLSX-laskentataulukoita ja EPUB-kirjoja. Ennen koulutusta, fine-tuningia tai RAG:ia ne on yhtenäistettävä siistiksi, rakenteiseksi tekstiksi.
Tässä näytetään, miten AnyMD:tä käytetään komentoriviltä ja Pythonista minkä tahansa asiakirjamuodon muuntamiseen Markdowniksi yhdellä vaiheella — ilman muotokohtaisia jäsentimiä tai siivousta.
Komentoriviltä
curl https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@paper.pdf"Siinä kaikki. AnyMD tunnistaa muodon tiedostopäätteestä. Sama komento toimii DOCX-, PPTX-, XLSX-, RTF-, EPUB-, ODT-, HTML- ja CSV-tiedostoille. Tallenna tulos tiedostoon:
curl -s https://anymd.net/api/convert \
-H "Authorization: Bearer your-key" \
-F "file=@research-paper.pdf" \
-o research-paper.mdPythonista
import requests
with open("report.pdf", "rb") as f:
resp = requests.post(
"https://anymd.net/api/convert",
headers={"Authorization": "Bearer your-key"},
files={"file": ("report.pdf", f)},
)
markdown = resp.text
print(markdown[:500])Erämuunnos koulutusdataa varten
import requests
from pathlib import Path
markdown_dir = Path("training_data_md")
markdown_dir.mkdir(exist_ok=True)
for doc in Path("raw_documents").glob("*"):
if doc.suffix not in {".pdf", ".docx", ".pptx", ".xlsx", ".epub"}:
continue
with open(doc, "rb") as f:
resp = requests.post("https://anymd.net/api/convert", headers={"Authorization": "Bearer your-key"}, files={"file": (doc.name, f)})
if resp.ok:
out = markdown_dir / f"{doc.stem}.md"
out.write_text(resp.text)Tämä riittää sekamuotoisen asiakirjakokoelman yhtenäistämiseen Markdowniksi, joka on valmis chunkingiin, embeddingeihin tai fine-tuningiin.
AnyMD on yksi API, yksi tulosmuoto (GFM Markdown) ja yksi todennusavain. Ei kirjastohallintaa, versiokonflikteja tai muotokohtaisia reunatapauksia.
Hae ilmainen API-avaimesi — 100 sivua/kk, ei korttia.