HTML→Markdown

Dokumentation in Markdown für LLM-Kontextfenster konvertieren

Große Sprachmodelle wie ChatGPT, Claude und Gemini arbeiten am besten mit sauberem, strukturiertem Text. Produktdokumentation liegt im Web aber als HTML vor, eingepackt in Navigationsleisten, Seitenleisten, Footer, Cookie-Banner und JavaScript, das mit dem Inhalt nichts zu tun hat.

Wer rohes HTML in einen Prompt kopiert, verbraucht Tokens im Kontextfenster für diese Boilerplate. Die Konvertierung in Markdown entfernt das Rauschen und das Modell bekommt nur den Inhalt.

Warum Markdown für LLMs

  • Token-Effizienz: Markdown braucht für denselben Inhalt etwa 60 % weniger Tokens als HTML
  • Struktur bleibt erhalten: Überschriften, Listen, Tabellen und Codeblöcke werden direkt zu Markdown-Syntax
  • Kein Ballast: Der Dichtealgorithmus entfernt Navigation, Werbung und Layout-Markup
  • Bereit für RAG: Sauberes Markdown lässt sich gut in Chunks für Embeddings und Retrieval-Augmented Generation teilen

So funktioniert es

  1. Dokumentation spiegeln: Laden Sie mit wget -r -np -k einen Dokumentationsbereich als HTML-Dateien herunter
  2. ZIP erstellen und hochladen: Packen Sie die HTML-Dateien in ein ZIP-Archiv und ziehen Sie es auf den Konverter
  3. Markdown herunterladen: Sie erhalten ein ZIP mit sauberen .md-Dateien für Ihren LLM-Workflow oder Ihre Vektordatenbank

Typische Einsätze

  • API-Referenzen in Claude Projects oder ChatGPT Custom GPTs laden
  • Eine RAG-Wissensbasis aus Produkthandbüchern aufbauen
  • Ein durchsuchbares Markdown-Archiv von Framework-Dokumentation für Offline-AI-Codierassistenten anlegen
  • Trainingsdaten aus technischen Wikis aufbereiten

Datenschutz

Ihre Dokumentation verlässt nie Ihren Browser. Die Konvertierung läuft lokal über WebAssembly, es wird nichts hochgeladen oder auf einem Server gespeichert. Damit eignet sich das Tool auch für interne und proprietäre Dokumentation.

Verwandte Themen