Dokumentation in Markdown für LLM-Kontextfenster konvertieren
Große Sprachmodelle wie ChatGPT, Claude und Gemini arbeiten am besten mit sauberem, strukturiertem Text. Produktdokumentation liegt im Web aber als HTML vor, eingepackt in Navigationsleisten, Seitenleisten, Footer, Cookie-Banner und JavaScript, das mit dem Inhalt nichts zu tun hat.
Wer rohes HTML in einen Prompt kopiert, verbraucht Tokens im Kontextfenster für diese Boilerplate. Die Konvertierung in Markdown entfernt das Rauschen und das Modell bekommt nur den Inhalt.
Warum Markdown für LLMs
- Token-Effizienz: Markdown braucht für denselben Inhalt etwa 60 % weniger Tokens als HTML
- Struktur bleibt erhalten: Überschriften, Listen, Tabellen und Codeblöcke werden direkt zu Markdown-Syntax
- Kein Ballast: Der Dichtealgorithmus entfernt Navigation, Werbung und Layout-Markup
- Bereit für RAG: Sauberes Markdown lässt sich gut in Chunks für Embeddings und Retrieval-Augmented Generation teilen
So funktioniert es
- Dokumentation spiegeln: Laden Sie mit
wget -r -np -keinen Dokumentationsbereich als HTML-Dateien herunter - ZIP erstellen und hochladen: Packen Sie die HTML-Dateien in ein ZIP-Archiv und ziehen Sie es auf den Konverter
- Markdown herunterladen: Sie erhalten ein ZIP mit sauberen
.md-Dateien für Ihren LLM-Workflow oder Ihre Vektordatenbank
Typische Einsätze
- API-Referenzen in Claude Projects oder ChatGPT Custom GPTs laden
- Eine RAG-Wissensbasis aus Produkthandbüchern aufbauen
- Ein durchsuchbares Markdown-Archiv von Framework-Dokumentation für Offline-AI-Codierassistenten anlegen
- Trainingsdaten aus technischen Wikis aufbereiten
Datenschutz
Ihre Dokumentation verlässt nie Ihren Browser. Die Konvertierung läuft lokal über WebAssembly, es wird nichts hochgeladen oder auf einem Server gespeichert. Damit eignet sich das Tool auch für interne und proprietäre Dokumentation.