Dokumentation in Markdown für LLM-Kontextfenster konvertieren
Große Sprachmodelle wie ChatGPT, Claude und Gemini arbeiten am besten, wenn man ihnen sauberen, strukturierten Text liefert. Aber Produktdokumentation lebt im Web als HTML — voller Navigationsleisten, Seitenleisten, Footer, Cookie-Banner und JavaScript, das nichts zum eigentlichen Inhalt beiträgt.
Rohes HTML in einen LLM-Prompt einzufügen verschwendet wertvolle Kontextfenster-Tokens für Boilerplate. Zuerst in Markdown zu konvertieren entfernt das Rauschen und liefert nur die Informationen, die das Modell zum Reasoning benötigt.
Warum Markdown für LLMs?
- Token-Effizienz — Markdown verwendet ~60 % weniger Tokens als gleichwertiges HTML für denselben Inhalt
- Strukturerhaltung — Überschriften, Listen, Tabellen und Codeblöcke werden direkt in Markdown-Syntax abgebildet
- Keine Ablenkungen — Navigation, Werbung und Layout-Markup werden durch den Dichtealgorithmus entfernt
- RAG-fähig — Sauberes Markdown lässt sich sauber für Embedding und Retrieval-Augmented Generation aufteilen
So funktioniert es
- Dokumentation spiegeln — Verwenden Sie
wget -r -np -k, um einen Dokumentationsabschnitt als HTML-Dateien herunterzuladen - ZIP erstellen und hochladen — Bündeln Sie die HTML-Dateien in ein ZIP-Archiv und ziehen Sie es auf den Konverter
- Markdown herunterladen — Erhalten Sie ein ZIP mit sauberen
.md-Dateien, bereit zum Einfügen in Ihren LLM-Workflow oder zur Indexierung in einer Vektordatenbank
Typische Anwendungsfälle
- API-Referenzdokumentation in Claude Projects oder ChatGPT Custom GPTs laden
- Eine RAG-Wissensbasis aus Produkthandbüchern aufbauen
- Ein durchsuchbares Markdown-Archiv von Framework-Dokumentation für Offline-AI-Codierungsassistenten erstellen
- Trainingsdaten aus technischen Wikis aufbereiten
Privatsphäre zuerst
Ihre Dokumentation verlässt nie Ihren Browser. Die Konvertierung läuft lokal über WebAssembly — kein Server-Upload, keine Cloud-Verarbeitung, keine Datenspeicherung. Ideal für proprietäre oder interne Dokumentation.