HTMLMarkdown

HTML zu Markdownfür AI

Konvertieren Sie HTML-Dateien in sauberes GitHub-Flavored Markdown für AI- und LLM-Workflows — vollständig in Ihrem Browser.

100% PrivatWebAssembly-GeschwindigkeitStapelverarbeitung

Initializing conversion engine…

Beliebte Anwendungsfälle

Alle anzeigen →

Wie man HTML-Seiten herunterlädt und ZIP-Pakete erstellt

Wie man HTML-Seiten herunterlädt und ein ZIP-Paket erstellt

Sie möchten eine Dokumentationsseite an ein LLM verfüttern? Spiegeln Sie sie mitwget, zippen Sie das Ergebnis und konvertieren Sie alles in einem Durchgang.

1. Seiten mit wget herunterladen

Lädt einen Dokumentationsbereich rekursiv herunter, bleibt im Startpfad und schreibt Links um, damit die Kopien offline funktionieren.

wget -r -np -k -E \
  --reject-regex '\.(png|jpe?g|gif|svg|webp|woff2?|ttf|css|js|zip|pdf)$' \
  -w 0.5 --random-wait \
  https://community.denodo.com/docs/html/browse/latest/en/vdp/developer/index

wget schreibt in einen Ordner mit dem Hostnamen, z. B. community.denodo.com/. Auf macOS zuerst mit brew install wget installieren.

2. HTML-Dateien in ein ZIP packen

Nur die .html-Dateien bündeln. Verschachtelte Ordner sind kein Problem — der Konverter liest sie in jeder Tiefe und spiegelt die Pfade in der Ausgabe.

cd community.denodo.com

# jede .html-Datei, Verzeichnisstruktur beibehalten
find . -name '*.html' -print | zip ../docs-html.zip -@

Alles so lassen? zip -r ../docs-html.zip . geht auch; nicht-HTML-Dateien werden beim Upload ignoriert.

3. ZIP oben ablegen

docs-html.zip in den Konverter hochladen. Jede Seite wird zu einer .md-Datei mit gleichem Namen und Pfad, zum Download als einzelnes Archiv.

# Archiv vor dem Upload prüfen
unzip -l docs-html.zip | grep -c '\.html$'   # ≤ 200 Dateien
du -h docs-html.zip                          # ≤ 100 MB

Was die wget-Flags bedeuten

-r
Links rekursiv folgen
-np
Nie über den Startpfad hinausgehen
-k
Links auf lokale Kopien umschreiben
-E
.html anhängen, damit jede Seite erkannt wird
-p
Optional: auch CSS und Bilder laden — nicht nötig für Markdown
-l 2
Crawl-Tiefe begrenzen — nützlich für große Seiten
-w 0.5 --random-wait
Anfragen drosseln, um höflich zu bleiben

Unter Windows

wget installieren mit winget install JernejSimoncic.wget, dann mit PowerShell zippen anstatt des zip-Befehls.

Compress-Archive -Path .\community.denodo.com\* -DestinationPath docs-html.zip

Nur Seiten crawlen, deren Nutzungsbedingungen dies erlauben, und die Anfragerate niedrig halten. Große Handbücher können das Limit von 200 Dateien pro Archiv überschreiten — Start-URL eingrenzen oder-l und in Stapeln konvertieren.

Vollständige Anleitung lesen →— behandelt curl, Browser-Speichern, Puppeteer, HTTrack und mehr