HTML für AI-Trainingsdaten aufbereiten
Sie bauen einen Feintuning-Datensatz oder ein Trainingskorpus aus Web-Inhalten? An das HTML zu kommen, ist der leichte Teil. Schwierig wird es beim Bereinigen. Jede Seite steckt in Navigation, Werbung, Cookie-Dialogen, Widgets mit verwandten Artikeln und Layout-Markup, das sonst in Ihren Trainingsdaten landet.
Dieses Tool findet den Hauptinhalt jeder Seite mit dichtebasierter Inhaltsextraktion und zieht ihn heraus. Das Ergebnis ist Markdown, das dem entspricht, was ein Mensch „den Artikel“ nennen würde.
Warum saubere Daten für AI-Training wichtig sind
- Qualität rein, Qualität raus: Modelle, die mit verrauschten Daten trainiert werden, lernen das Rauschen mit (Navigationstexte, Cookie-Hinweise, „Hier klicken“-Muster)
- Deduplizierung: Boilerplate (Header, Footer, Navigation) wiederholt sich über Tausende Seiten und füllt Ihr Korpus mit ungewollten Duplikaten
- Token-Effizienz: Mit reinem Inhaltstext lernt das Modell mit jedem Token etwas über die Domäne statt über das Seitenlayout
- Bessere Evaluation: Saubere Testsets zeigen ehrlich, wie gut das Modell mit echtem Inhalt umgeht
Der Dichte-Algorithmus
Der Konverter bewertet jedes Container-Element (<div>, <section>,<article>, <main>) nach drei Kriterien:
- Textdichte: Verhältnis von sichtbarem Text zu HTML-Markup im Container
- Strukturelle Signale: Überschriften, Absätze und semantische Elemente
- Rausch-Indikatoren: Navigationslinks, Formularelemente und die wiederkehrenden Muster typischer Boilerplate
Der Container mit der höchsten Punktzahl wird zum Inhaltsblock. Alles andere (Navigation, Footer, Seitenleiste, Werbung) wird vor der Konvertierung verworfen.
So funktioniert es
- HTML sammeln: Crawlen, scrapen oder exportieren Sie die Seiten, die in Ihr Trainingsset sollen
- Im Stapel konvertieren: Packen Sie bis zu 200 HTML-Dateien in ein ZIP und laden Sie es hoch (bis zu 100 MB pro Archiv)
- Sauberes Markdown herunterladen: Jede Datei wird einzeln verarbeitet, eine fehlerhafte Seite hält den Rest also nicht auf
- In Ihrer Pipeline verwenden: Geben Sie die
.md-Dateien an Ihren Tokenizer, Chunker oder Ihr Feintuning-Skript weiter
Vergleich mit anderen Ansätzen
| Ansatz | Vorteile | Nachteile |
|---|---|---|
| Regex-Stripping | Schnell | Fragil, seitenspezifisch, übersieht semantische Struktur |
| BeautifulSoup + Heuristiken | Flexibel | Braucht Anpassung pro Website, langsam bei großen Mengen |
| Readability.js | Gut für Artikel | Für Einzelseiten gebaut, nicht für Stapelverarbeitung |
| Dieses Tool (Dichte-Extraktion) | Funktioniert ohne Anpassung auf jeder Website, Stapelverarbeitung, GFM-Ausgabe | Kann bei sehr ungewöhnlichen Layouts danebenliegen |
Tipps für Trainingsdaten
- Nach Domain oder Thema getrennt konvertieren, damit jeder Satz thematisch einheitlich bleibt
- Eine Stichprobe der Ergebnisse prüfen, bevor sie in die Trainingspipeline gehen
- Leere Ergebnisse (Seiten ohne extrahierbaren Inhalt) aussortieren, meist sind das Index- oder Übersichtsseiten
- Mit Metadaten (Quell-URL, Datum, Kategorie) kombinieren, um die Datensätze anzureichern
Datenschutz
Die Verarbeitung läuft komplett in Ihrem Browser über WebAssembly. Ihre Trainingsdaten werden nie auf einen Server hochgeladen. Das zählt besonders bei proprietären Inhalten, lizenzierten Datensätzen oder Daten, für die vertragliche Vereinbarungen gelten.