HTML→Markdown

Gescraptes HTML in Markdown für AI-Pipelines konvertieren

Web Scraping liefert rohes HTML: Navigation, Werbung, Cookie-Dialoge und Layout-Markup, das Ihre AI-Pipeline nicht braucht. Gescrapte Seiten von Hand zu bereinigen, funktioniert nicht mehr, sobald Sie Hunderte oder Tausende davon verarbeiten.

Der Konverter bewertet jeden Teil einer Seite nach Textdichte, um den eigentlichen Inhalt zu finden. Navigationsleisten, Footer, Seitenleisten und Werbeblöcke fliegen raus, der Rest wird in GitHub-Flavored Markdown konvertiert.

Das Problem mit rohem gescraptem HTML

  • Rauschanteil: Eine typische Webseite besteht zu 70 bis 80 % aus Boilerplate und nur zu 20 bis 30 % aus Inhalt
  • Uneinheitliche Struktur: Jede Website hat ein anderes Layout, deshalb bricht Regex-basierte Extraktion schnell
  • Verschwendete Tokens: Wer rohes HTML an ein LLM gibt, bezahlt Tokens für <nav>, <footer> und Inline-Styles
  • Embedding-Qualität: Embeddings von verrauschtem HTML liefern schlechte Suchergebnisse

So funktioniert es

  1. Ziel scrapen: Laden Sie die Seiten mit wget, Scrapy, Puppeteer oder einem anderen Crawler als .html-Dateien herunter
  2. Ausgabe zippen: Packen Sie das gescrapte HTML in ein ZIP-Archiv (bis zu 200 Dateien, 100 MB)
  3. Im Browser konvertieren: Die WASM-Engine bewertet jedes Container-Element nach Textdichte, wählt den Inhaltsblock aus und gibt GFM-Markdown aus
  4. Ergebnisse herunterladen: Sie erhalten saubere .md-Dateien in der ursprünglichen Verzeichnisstruktur

Funktioniert mit jedem Scraper

  • wget -r, rekursive Website-Spiegelung
  • Scrapy, das Python-Crawling-Framework
  • Puppeteer / Playwright, Scraping mit Headless-Browser (als HTML speichern)
  • curl + Skripte, Downloads eigener URL-Listen
  • HTTrack, der Website-Kopierer

Gut geeignet für

  • RAG-Wissensbasen (Retrieval-Augmented Generation) aus öffentlicher Dokumentation
  • Trainingsdatensätze für domänenspezifische Modelle
  • Die Migration von Web-Inhalten in Markdown-basierte Systeme (Obsidian, Notion, MkDocs)
  • Die Archivierung von Websites in einem lesbaren, durchsuchbaren Format

Datenschutz

Die gesamte Verarbeitung läuft lokal in Ihrem Browser über WebAssembly. Ihre gescrapten Inhalte werden nie auf einen Server hochgeladen. Das Tool eignet sich damit auch für proprietäre Daten, interne Wikis und sensibles Material.

Verwandte Themen