HTML-Seiten für die Konvertierung herunterladen
Bevor Sie HTML in Markdown konvertieren können, benötigen Sie die HTML-Dateien auf Ihrem Rechner. Diese Anleitung behandelt alle gängigen Methoden — vom Ein-Klick-Speichern im Browser bis zur vollständigen rekursiven Seitenspiegelung. Wählen Sie den Ansatz, der zu Ihrem Szenario passt.
Methode 1: wget — Rekursive Seitenspiegelung
Ideal für: Dokumentationsseiten, Produkthandbücher, Entwicklerreferenzen — jede Seite mit einer klaren URL-Hierarchie.
Grundbefehl
wget -r -np -k -E \
-w 0.5 --random-wait \
https://docs.example.com/en/latest/Was die Flags bewirken
| Flag | Zweck |
|---|---|
-r | Links rekursiv folgen |
-np | Nie über den Startpfad hinausgehen (innerhalb des Docs-Bereichs bleiben) |
-k | Links umschreiben, damit sie auf lokale Dateien zeigen |
-E | .html an URLs ohne Erweiterung anhängen, damit der Konverter sie erkennt |
-w 0.5 | 0,5 Sekunden zwischen Anfragen warten |
--random-wait | Verzögerung zufällig variieren, damit es weniger automatisiert wirkt |
Bilder und Assets überspringen (empfohlen)
Sie benötigen nur die HTML-Dateien. Binärdateien ablehnen, um Bandbreite und Speicherplatz zu sparen:
wget -r -np -k -E \
--reject-regex '\.(png|jpe?g|gif|svg|webp|woff2?|ttf|css|js|zip|pdf)$' \
-w 0.5 --random-wait \
https://community.denodo.com/docs/html/browse/latest/en/vdp/developer/indexCrawl-Tiefe begrenzen
Bei großen Seiten die Tiefe begrenzen, in der wget Links folgt:
# Nur 2 Ebenen tief ab der Start-URL
wget -r -np -k -E -l 2 \
-w 0.5 --random-wait \
https://docs.example.com/en/latest/wget installieren
| System | Befehl |
|---|---|
| macOS | brew install wget |
| Ubuntu/Debian | sudo apt install wget |
| Windows | winget install JernejSimoncic.wget |
Methode 2: curl — Eine URL-Liste herunterladen
Ideal für: wenn Sie eine bestimmte Liste von Seiten haben (aus einer Sitemap, einem Inhaltsverzeichnis oder einer URL-Datei).
Von einer URL-Liste herunterladen
# urls.txt — eine URL pro Zeile
https://docs.example.com/page-1.html
https://docs.example.com/page-2.html
https://docs.example.com/api/reference.html# Alle Seiten herunterladen, Verzeichnisstruktur beibehalten
while IFS= read -r url; do
path=$(echo "$url" | sed 's|https\?://[^/]*/||')
mkdir -p "$(dirname "downloaded/$path")"
curl -s -o "downloaded/$path" "$url"
sleep 0.5
done < urls.txtURLs aus einer Sitemap extrahieren
# URLs aus sitemap.xml extrahieren
curl -s https://docs.example.com/sitemap.xml \
| grep -oP '<loc>\K[^<]+' \
| grep '\.html' \
> urls.txtMethode 3: Browser — Einzelne Seiten speichern
Ideal für: einige wenige Seiten oder Websites, die Login/Authentifizierung erfordern.
- Öffnen Sie die Seite in Chrome/Firefox/Edge
- Drücken Sie Strg+S (Windows/Linux) oder ⌘+S (macOS)
- Wählen Sie „Webseite, nur HTML" (nicht „Komplett" — Sie brauchen keine Bilder/CSS)
- In einem Ordner speichern
- Für jede Seite wiederholen oder eine Browser-Erweiterung zum Batch-Speichern verwenden
Browser-Erweiterungen zum Batch-Speichern
- SingleFile (Chrome/Firefox) — speichert Seiten als eigenständige HTML-Dateien
- Save All Resources (Chrome) — speichert offene Tabs als HTML in großen Mengen
- DownThemAll (Firefox) — Download-Manager, der alle Links auf einer Seite erfassen kann
Methode 4: HTTrack — GUI-Website-Kopierer
Ideal für: Benutzer, die eine grafische Oberfläche der Kommandozeile vorziehen.
- HTTrack von
httrack.comherunterladen (Windows/Linux/macOS) - Start-URL eingeben und Filter konfigurieren (nur HTML)
- Die Seite spiegeln lassen
- HTML-Dateien im Ausgabeordner finden
Methode 5: Puppeteer/Playwright — JavaScript-gerenderte Seiten
Ideal für: Single-Page-Apps (SPAs) und Websites, die Inhalte mit JavaScript rendern. wget und curl erfassen nur das initiale HTML — wenn der Inhalt dynamisch geladen wird, brauchen Sie einen Headless-Browser.
// save-pages.mjs — Node.js + Playwright
import { chromium } from 'playwright';
import { writeFileSync, mkdirSync } from 'fs';
const urls = [
'https://spa-docs.example.com/getting-started',
'https://spa-docs.example.com/api-reference',
];
const browser = await chromium.launch();
const page = await browser.newPage();
for (const url of urls) {
await page.goto(url, { waitUntil: 'networkidle' });
const html = await page.content();
const filename = url.split('/').pop() + '.html';
mkdirSync('pages', { recursive: true });
writeFileSync(`pages/${filename}`, html);
console.log(`Saved: ${filename}`);
}
await browser.close();Das ZIP-Paket erstellen
Wenn Sie Ihre HTML-Dateien heruntergeladen haben, bündeln Sie sie in eine ZIP-Datei für den Konverter:
macOS / Linux
# Innerhalb des heruntergeladenen Ordners:
cd community.denodo.com
# Nur HTML-Dateien zippen, Verzeichnisstruktur beibehalten
find . -name '*.html' -print | zip ../docs.zip -@Oder alles zippen (Nicht-HTML-Dateien werden vom Konverter ignoriert):
zip -r ../docs.zip .Windows (PowerShell)
Compress-Archive -Path .\downloaded\* -DestinationPath docs.zipWindows (Datei-Explorer)
- Den Ordner mit Ihren HTML-Dateien auswählen
- Rechtsklick → In ZIP-Datei komprimieren
ZIP vor dem Upload prüfen
Der Konverter akzeptiert ZIPs bis 100 MB mit bis zu 200 HTML-Dateien:
# HTML-Dateien zählen
unzip -l docs.zip | grep -c '\.html$'
# Gesamtgröße prüfen
du -h docs.zipWenn Ihr Archiv die Grenzen überschreitet, teilen Sie es nach Unterverzeichnissen auf und konvertieren Sie in Stapeln.
Tipps und Best Practices
- robots.txt beachten — Prüfen Sie die robots.txt der Website vor dem Crawling. Fügen Sie
-e robots=onzu wget hinzu (ist standardmäßig aktiv) - Anfragen drosseln — Fügen Sie immer eine Verzögerung zwischen Anfragen hinzu (
-w 0.5mindestens), um den Server nicht zu überlasten - Nutzungsbedingungen prüfen — Einige Websites verbieten automatisiertes Herunterladen in ihren AGB
-Ebei wget verwenden — Dadurch werden URLs ohne Erweiterung als.html-Dateien gespeichert, die der Konverter erkennen kann- Zuerst mit einem kleinen Bereich testen — Fügen Sie
-l 1hinzu, um die Tiefe zu begrenzen, und prüfen Sie die Ausgabe vor einem vollständigen Crawl - Login-geschützte Seiten — Verwenden Sie
wget --load-cookiesmit exportierten Browser-Cookies oder speichern Sie Seiten manuell über den Browser
Nächster Schritt
Sobald Ihre ZIP-Datei bereit ist, öffnen Sie den Konverter und ziehen Sie sie hinein. Die Konvertierung erfolgt vollständig in Ihrem Browser — Ihre Dateien werden nie auf einen Server hochgeladen.