HTML für AI-Trainingsdaten aufbereiten
Sie erstellen einen Feintuning-Datensatz oder ein Trainingskorpus aus Web-Inhalten? Die größte Herausforderung ist nicht, an das HTML zu kommen — sondern es zu bereinigen. Jede Webseite ist in Navigation, Werbung, Cookie-Dialoge, Verwandte-Artikel-Widgets und Layout-Markup gehüllt, das Ihre Trainingsdaten verunreinigt.
Dieses Tool wendet einen dichtebasierten Inhaltsextraktionsalgorithmus an (derselbe Ansatz, der in der akademischen Forschung zur Boilerplate-Entfernung verwendet wird), um automatisch den Hauptinhalt jeder Seite zu identifizieren und zu extrahieren. Das Ergebnis ist sauberes, strukturiertes Markdown, das repräsentiert, was ein Mensch als „den Artikel" betrachten würde.
Warum saubere Daten für AI-Training wichtig sind
- Qualität rein, Qualität raus — Modelle, die mit verrauschten Daten trainiert werden, lernen, Rauschen zu reproduzieren (Navigationstext, Cookie-Einwilligungsphrasen, „Hier klicken"-Muster)
- Deduplizierung — Boilerplate-Text (Header, Footer, Navigation) ist über Tausende von Seiten identisch und erzeugt massive unbeabsichtigte Duplikate in Ihrem Korpus
- Token-Effizienz — Training mit reinem Inhaltstext bedeutet, dass jeder Token zum Lernen der Domäne beiträgt, nicht zum Seitenchrome
- Bessere Evaluation — Saubere Testsets geben Ihnen ehrliche Metriken über die Modellleistung bei tatsächlichem Inhalt
Der Dichte-Extraktionsalgorithmus
Der Konverter bewertet jedes Container-Element (<div>, <section>,<article>, <main>) durch Berechnung eines Signal-Scores basierend auf:
- Textdichte — Verhältnis von sichtbarem Text zu HTML-Markup innerhalb des Containers
- Strukturelle Signale — Vorhandensein von Überschriften, Absätzen und semantischen Elementen
- Rausch-Indikatoren — Navigationslinks, Formularelemente und repetitive Muster, die typisch für Boilerplate sind
Der Container mit dem höchsten Score wird als Inhaltsblock ausgewählt. Alles andere — Navigation, Footer, Seitenleiste, Werbung — wird vor der Markdown-Konvertierung verworfen.
So funktioniert es
- HTML sammeln — Crawlen, scrapen oder exportieren Sie die Seiten, die Sie in Ihrem Trainingsset haben möchten
- Batch-Konvertierung — Zippen Sie bis zu 200 HTML-Dateien und laden Sie sie hoch (bis zu 100 MB pro Archiv)
- Sauberes Markdown herunterladen — Jede Datei wird unabhängig verarbeitet, sodass eine fehlerhafte Seite den Rest nicht blockiert
- In Ihrer Pipeline verwenden — Füttern Sie die
.md-Dateien in Ihren Tokenizer, Chunker oder Ihr Feintuning-Skript
Vergleich mit anderen Ansätzen
| Ansatz | Vorteile | Nachteile |
|---|---|---|
| Regex-Stripping | Schnell | Fragil, seitenspezifisch, übersieht semantische Struktur |
| BeautifulSoup + Heuristiken | Flexibel | Erfordert Anpassung pro Seite, langsam bei großen Batches |
| Readability.js | Gut für Artikel | Für Einzelseiten konzipiert, nicht für Batch-Verarbeitung |
| Dieses Tool (Dichte-Extraktion) | Funktioniert auf jeder Seite ohne Anpassung, Batch-Verarbeitung, GFM-Ausgabe | Kann bei sehr ungewöhnlichen Layouts eingeschränkt sein |
Best Practices für Trainingsdaten
- In Batches nach Domain/Thema konvertieren für thematische Konsistenz
- Eine Stichprobe der Ausgaben prüfen, bevor Sie sie in Ihre Trainingspipeline einspeisen
- Leere Ergebnisse herausfiltern (Seiten ohne extrahierbaren Inhalt) — diese deuten auf Nicht-Artikel-Seiten wie Index-/Auflistungsseiten hin
- Mit Metadaten kombinieren (Quell-URL, Datum, Kategorie) für reichhaltigere Datensätze
Datenschutz
Die Verarbeitung erfolgt vollständig in Ihrem Browser über WebAssembly. Ihre Trainingsdaten werden nie auf einen Server hochgeladen. Das ist besonders wichtig bei der Arbeit mit proprietären Inhalten, lizenzierten Datensätzen oder Daten, die Vereinbarungen unterliegen.