HTML→Markdown

Kostenlos · Privat · Kein Upload

Jedes Dokument zu Markdown für AI

Ziehen Sie PDFs, Word-Dateien, Folien, Tabellen oder ganze Website-Exporte hinein. Sie erhalten in Sekunden sauberes Markdown für LLMs, direkt in Ihrem Browser.

PDFDOCXHTMLXLSXPPTXEPUBCSVRTF

Initializing conversion engine…

Chaos rein. Sauber raus.

Navigation, Cookie-Banner und Div-Suppe verschwinden. Überschriften, Listen und Tabellen bleiben.

QuellseiteBeispiel
<nav>Start · Preise · Login</nav>
<div class="cookie">Wir nutzen Cookies…</div>
<h1>Quartalsbericht</h1>
<div><span>Umsatz um 12 % gestiegen</span></div>
<ul><li>EMEA</li><li>APAC</li></ul>
<footer>© Acme · Impressum · Datenschutz</footer>
Markdown.md
# Quartalsbericht
 
Umsatz um 12 % gestiegen
 
- EMEA
- APAC

Weniger Tokens, gleicher Inhalt

Boilerplate, Skripte und Layout-Markup fallen weg. Ihr Kontextfenster enthält Inhalt statt Ballast.

Struktur bleibt erhalten

Überschriften, Listen, Links und Tabellen landen als GitHub-Flavored Markdown, das Modelle gut lesen.

Privat von Grund auf

WebAssembly arbeitet auf Ihrem Rechner. Kein Konto, kein Upload, keine Serverkopie Ihrer Dateien.

Beliebte Anwendungsfälle

Alle anzeigen →

Den nächsten Stapel konvertieren

Sie können beliebig viele Runden starten. Jedes Ergebnis bleibt auf dieser Seite, bis Sie es löschen.

Zurück zur Ablagefläche

Wünsche, Verbesserungsvorschläge oder Bugs? Schreib uns hier:

html-to-markdown-ai - Bulk-convert HTML to Markdown for AI - private, in-browser | Product Hunt

Wie man HTML-Seiten herunterlädt und ZIP-Pakete erstellt

Wie man HTML-Seiten herunterlädt und ein ZIP-Paket erstellt

Sie möchten eine Dokumentationsseite an ein LLM verfüttern? Spiegeln Sie sie mitwget, zippen Sie das Ergebnis und konvertieren Sie alles in einem Durchgang.

1. Seiten mit wget herunterladen

Lädt einen Dokumentationsbereich rekursiv herunter, bleibt im Startpfad und schreibt Links um, damit die Kopien offline funktionieren.

wget -r -np -k -E \
  --reject-regex '\.(png|jpe?g|gif|svg|webp|woff2?|ttf|css|js|zip|pdf)$' \
  -w 0.5 --random-wait \
  https://community.denodo.com/docs/html/browse/latest/en/vdp/developer/index

wget schreibt in einen Ordner mit dem Hostnamen, z. B. community.denodo.com/. Auf macOS zuerst mit brew install wget installieren.

2. HTML-Dateien in ein ZIP packen

Nur die .html-Dateien bündeln. Verschachtelte Ordner sind kein Problem; der Konverter liest sie in jeder Tiefe und spiegelt die Pfade in der Ausgabe.

cd community.denodo.com

# jede .html-Datei, Verzeichnisstruktur beibehalten
find . -name '*.html' -print | zip ../docs-html.zip -@

Alles so lassen? zip -r ../docs-html.zip . geht auch; nicht-HTML-Dateien werden beim Upload ignoriert.

3. ZIP oben ablegen

docs-html.zip in den Konverter hochladen. Jede Seite wird zu einer .md-Datei mit gleichem Namen und Pfad, zum Download als einzelnes Archiv.

# Archiv vor dem Upload prüfen
unzip -l docs-html.zip | grep -c '\.html$'   # ≤ 200 Dateien
du -h docs-html.zip                          # ≤ 100 MB

Was die wget-Flags bedeuten

-r
Links rekursiv folgen
-np
Nie über den Startpfad hinausgehen
-k
Links auf lokale Kopien umschreiben
-E
.html anhängen, damit jede Seite erkannt wird
-p
Optional: auch CSS und Bilder laden, für Markdown nicht nötig
-l 2
Crawl-Tiefe begrenzen, nützlich für große Seiten
-w 0.5 --random-wait
Anfragen drosseln, um höflich zu bleiben

Unter Windows

wget installieren mit winget install JernejSimoncic.wget, dann mit PowerShell zippen anstatt des zip-Befehls.

Compress-Archive -Path .\community.denodo.com\* -DestinationPath docs-html.zip

Nur Seiten crawlen, deren Nutzungsbedingungen dies erlauben, und die Anfragerate niedrig halten. Große Handbücher können das Limit von 200 Dateien pro Archiv überschreiten; Start-URL eingrenzen oder-l und in Stapeln konvertieren.

Vollständige Anleitung lesen →Behandelt außerdem curl, Browser-Speichern, Puppeteer, HTTrack und mehr.