HTMLMarkdown

HTML für AI-Trainingsdaten aufbereiten

Sie erstellen einen Feintuning-Datensatz oder ein Trainingskorpus aus Web-Inhalten? Die größte Herausforderung ist nicht, an das HTML zu kommen — sondern es zu bereinigen. Jede Webseite ist in Navigation, Werbung, Cookie-Dialoge, Verwandte-Artikel-Widgets und Layout-Markup gehüllt, das Ihre Trainingsdaten verunreinigt.

Dieses Tool wendet einen dichtebasierten Inhaltsextraktionsalgorithmus an (derselbe Ansatz, der in der akademischen Forschung zur Boilerplate-Entfernung verwendet wird), um automatisch den Hauptinhalt jeder Seite zu identifizieren und zu extrahieren. Das Ergebnis ist sauberes, strukturiertes Markdown, das repräsentiert, was ein Mensch als „den Artikel" betrachten würde.

Warum saubere Daten für AI-Training wichtig sind

Der Dichte-Extraktionsalgorithmus

Der Konverter bewertet jedes Container-Element (<div>, <section>,<article>, <main>) durch Berechnung eines Signal-Scores basierend auf:

Der Container mit dem höchsten Score wird als Inhaltsblock ausgewählt. Alles andere — Navigation, Footer, Seitenleiste, Werbung — wird vor der Markdown-Konvertierung verworfen.

So funktioniert es

  1. HTML sammeln — Crawlen, scrapen oder exportieren Sie die Seiten, die Sie in Ihrem Trainingsset haben möchten
  2. Batch-Konvertierung — Zippen Sie bis zu 200 HTML-Dateien und laden Sie sie hoch (bis zu 100 MB pro Archiv)
  3. Sauberes Markdown herunterladen — Jede Datei wird unabhängig verarbeitet, sodass eine fehlerhafte Seite den Rest nicht blockiert
  4. In Ihrer Pipeline verwenden — Füttern Sie die .md-Dateien in Ihren Tokenizer, Chunker oder Ihr Feintuning-Skript

Vergleich mit anderen Ansätzen

AnsatzVorteileNachteile
Regex-StrippingSchnellFragil, seitenspezifisch, übersieht semantische Struktur
BeautifulSoup + HeuristikenFlexibelErfordert Anpassung pro Seite, langsam bei großen Batches
Readability.jsGut für ArtikelFür Einzelseiten konzipiert, nicht für Batch-Verarbeitung
Dieses Tool (Dichte-Extraktion)Funktioniert auf jeder Seite ohne Anpassung, Batch-Verarbeitung, GFM-AusgabeKann bei sehr ungewöhnlichen Layouts eingeschränkt sein

Best Practices für Trainingsdaten

Datenschutz

Die Verarbeitung erfolgt vollständig in Ihrem Browser über WebAssembly. Ihre Trainingsdaten werden nie auf einen Server hochgeladen. Das ist besonders wichtig bei der Arbeit mit proprietären Inhalten, lizenzierten Datensätzen oder Daten, die Vereinbarungen unterliegen.

Verwandte Themen