Gescraptes HTML in Markdown für AI-Pipelines konvertieren
Web Scraping liefert Ihnen rohes HTML — komplett mit Navigation, Werbung, Cookie-Einwilligungsdialogen und Layout-Markup, das Ihre AI-Pipeline nicht braucht. Gescrapte Seiten manuell zu bereinigen skaliert nicht, wenn Sie Hunderte oder Tausende von Seiten verarbeiten.
Dieser Konverter verwendet einen dichtebasierten Inhaltsextraktionsalgorithmus, um automatisch den „echten Inhalt" auf jeder Seite zu identifizieren. Navigationsleisten, Footer, Seitenleisten und Werbeblöcke werden entfernt. Was übrig bleibt, wird in sauberes GitHub-Flavored Markdown konvertiert.
Das Problem mit rohem gescraptem HTML
- Rauschanteil — Eine typische Webseite besteht zu 70–80 % aus Boilerplate; nur 20–30 % ist tatsächlicher Inhalt
- Inkonsistente Struktur — Jede Website verwendet andere Layouts, was Regex-basierte Extraktion unzuverlässig macht
- Token-Verschwendung — Rohes HTML an ein LLM zu verfüttern verbraucht Tokens für
<nav>,<footer>und Inline-Styles - Embedding-Qualität — Vektor-Embeddings von verrauschtem HTML liefern schlechte Retrieval-Ergebnisse
So funktioniert es
- Ziel scrapen — Verwenden Sie wget, Scrapy, Puppeteer oder einen beliebigen Crawler, um Seiten als
.html-Dateien herunterzuladen - Ausgabe zippen — Bündeln Sie das gescrapte HTML in ein ZIP-Archiv (bis zu 200 Dateien, 100 MB)
- Im Browser konvertieren — Die WASM-Engine bewertet jedes Container-Element nach Textdichte, wählt den Inhaltsblock aus und gibt GFM-Markdown aus
- Ergebnisse herunterladen — Erhalten Sie saubere
.md-Dateien, die die ursprüngliche Verzeichnisstruktur beibehalten
Funktioniert mit jedem Scraper
wget -r— rekursive Seitenspiegelung- Scrapy — Python-Crawling-Framework
- Puppeteer / Playwright — Headless-Browser-Scraping (als HTML speichern)
- curl + Skripte — Downloads von benutzerdefinierten URL-Listen
- HTTrack — Website-Kopierer
Ideal für
- Aufbau von RAG-Wissensbasen (Retrieval-Augmented Generation) aus öffentlicher Dokumentation
- Erstellung von Trainingsdatensätzen für domänenspezifische Modelle
- Migration von Web-Inhalten zu Markdown-basierten Systemen (Obsidian, Notion, MkDocs)
- Archivierung von Websites in einem lesbaren, durchsuchbaren Format
Datenschutz-Garantie
Die gesamte Verarbeitung läuft lokal in Ihrem Browser mittels WebAssembly. Ihre gescrapten Inhalte werden nie auf einen Server hochgeladen — sicher für proprietäre Daten, interne Wikis und sensibles Material.