HTML→Markdown

HTML für AI-Trainingsdaten aufbereiten

Sie bauen einen Feintuning-Datensatz oder ein Trainingskorpus aus Web-Inhalten? An das HTML zu kommen, ist der leichte Teil. Schwierig wird es beim Bereinigen. Jede Seite steckt in Navigation, Werbung, Cookie-Dialogen, Widgets mit verwandten Artikeln und Layout-Markup, das sonst in Ihren Trainingsdaten landet.

Dieses Tool findet den Hauptinhalt jeder Seite mit dichtebasierter Inhaltsextraktion und zieht ihn heraus. Das Ergebnis ist Markdown, das dem entspricht, was ein Mensch „den Artikel“ nennen würde.

Warum saubere Daten für AI-Training wichtig sind

  • Qualität rein, Qualität raus: Modelle, die mit verrauschten Daten trainiert werden, lernen das Rauschen mit (Navigationstexte, Cookie-Hinweise, „Hier klicken“-Muster)
  • Deduplizierung: Boilerplate (Header, Footer, Navigation) wiederholt sich über Tausende Seiten und füllt Ihr Korpus mit ungewollten Duplikaten
  • Token-Effizienz: Mit reinem Inhaltstext lernt das Modell mit jedem Token etwas über die Domäne statt über das Seitenlayout
  • Bessere Evaluation: Saubere Testsets zeigen ehrlich, wie gut das Modell mit echtem Inhalt umgeht

Der Dichte-Algorithmus

Der Konverter bewertet jedes Container-Element (<div>, <section>,<article>, <main>) nach drei Kriterien:

  • Textdichte: Verhältnis von sichtbarem Text zu HTML-Markup im Container
  • Strukturelle Signale: Überschriften, Absätze und semantische Elemente
  • Rausch-Indikatoren: Navigationslinks, Formularelemente und die wiederkehrenden Muster typischer Boilerplate

Der Container mit der höchsten Punktzahl wird zum Inhaltsblock. Alles andere (Navigation, Footer, Seitenleiste, Werbung) wird vor der Konvertierung verworfen.

So funktioniert es

  1. HTML sammeln: Crawlen, scrapen oder exportieren Sie die Seiten, die in Ihr Trainingsset sollen
  2. Im Stapel konvertieren: Packen Sie bis zu 200 HTML-Dateien in ein ZIP und laden Sie es hoch (bis zu 100 MB pro Archiv)
  3. Sauberes Markdown herunterladen: Jede Datei wird einzeln verarbeitet, eine fehlerhafte Seite hält den Rest also nicht auf
  4. In Ihrer Pipeline verwenden: Geben Sie die .md-Dateien an Ihren Tokenizer, Chunker oder Ihr Feintuning-Skript weiter

Vergleich mit anderen Ansätzen

AnsatzVorteileNachteile
Regex-StrippingSchnellFragil, seitenspezifisch, übersieht semantische Struktur
BeautifulSoup + HeuristikenFlexibelBraucht Anpassung pro Website, langsam bei großen Mengen
Readability.jsGut für ArtikelFür Einzelseiten gebaut, nicht für Stapelverarbeitung
Dieses Tool (Dichte-Extraktion)Funktioniert ohne Anpassung auf jeder Website, Stapelverarbeitung, GFM-AusgabeKann bei sehr ungewöhnlichen Layouts danebenliegen

Tipps für Trainingsdaten

  • Nach Domain oder Thema getrennt konvertieren, damit jeder Satz thematisch einheitlich bleibt
  • Eine Stichprobe der Ergebnisse prüfen, bevor sie in die Trainingspipeline gehen
  • Leere Ergebnisse (Seiten ohne extrahierbaren Inhalt) aussortieren, meist sind das Index- oder Übersichtsseiten
  • Mit Metadaten (Quell-URL, Datum, Kategorie) kombinieren, um die Datensätze anzureichern

Datenschutz

Die Verarbeitung läuft komplett in Ihrem Browser über WebAssembly. Ihre Trainingsdaten werden nie auf einen Server hochgeladen. Das zählt besonders bei proprietären Inhalten, lizenzierten Datensätzen oder Daten, für die vertragliche Vereinbarungen gelten.

Verwandte Themen