Über dieses Projekt
Hey, ich bin Christoph. Ich bin Cloud Systems Engineer. Wenn ich nicht gerade an AWS-Infrastrukturen arbeite oder handwerkliche Projekte am Haus umsetze, baue ich kleine Tools. Ich mag Tools, die genau ein Problem lösen und einfach funktionieren. So ist auch dieser Konverter entstanden.
Das Problem
Ich brauchte sauberes Markdown aus bestehenden Dokumentationen. Der Workflow sollte simpel sein: eine Docs-Seite mit wget spiegeln, den Ordner in einen Konverter werfen und strukturiertes Markdown für eine RAG-Pipeline zurückbekommen. Ohne Anmeldung und ohne API-Key. Vor allem wollte ich keine internen Firmen-Dokumente auf fremde Server schieben. Bei Kundendaten ist das schlichtweg keine Option.
Bestehende Tools hatten immer Haken.
- Datenschutz: Fast alle Tools laden Dateien in die Cloud hoch. Bei internen Docs oder NDAs geht das gar nicht.
- Qualität: Normale Konverter behalten den ganzen Schrott. Navbars, Cookie-Banner und Sidebars bleiben erhalten. Dieses Rauschen verbrennt LLM-Tokens ohne jeden Mehrwert.
- Skalierung: 500 HTML-Dateien einzeln anzuklicken, ist kein Workflow. Dokumentation lebt in Verzeichnisbäumen.
Also habe ich gebaut, was ich brauchte. Der Konverter läuft komplett im Browser, filtert strukturelles Rauschen selbst heraus und frisst ganze ZIP-Archive auf einmal. Der Output ist sauber genug, um ihn direkt in ein Kontextfenster zu kopieren.
So funktioniert es
Du ziehst HTML, PDFs, Word-Dokumente oder Excel-Tabellen in das Fenster. Der Konverter entfernt Navigation, Skripte und Boilerplate. Übrig bleibt sauberes Markdown für ChatGPT, Claude oder RAG-Pipelines. Alles passiert direkt im Arbeitsspeicher deines Browsers. Keine Datei verlässt jemals deinen Rechner.
Unterstützte Formate
- HTML: .html, .htm und dateiendungslose Scrapes
- Word: .doc, .docx, .docm
- PowerPoint: .ppt, .pptx, .pptm, .pps, .ppsx
- Excel: .xls, .xlsx, .xlsm, .xlsb
- OpenDocument: .odt, .ods, .odp
- PDF: Textbasierte PDFs, dazu integrierte OCR für gescannte Seiten
- Weitere: .rtf, .epub, .csv
Technologie
- HTML-Konvertierung: Eigene Rust-WASM-Engine (52KB). Filtert Rauschen basierend auf Textdichte.
- Dokumente: anydoc von Firecrawl. Selbst kompiliert und auf Dateigröße optimiert.
- OCR: PaddleOCR-Modelle auf ONNX Runtime Web. PDF.js rendert die gescannten Seiten.
- Frontend: Astro, Preact und Tailwind CSS.
- ZIP-Verarbeitung: fflate für schnelles lokales Entpacken.
Datenschutz nach Architektur
Nach dem initialen Laden der Seite löst die Konvertierung keine Netzwerkanfragen aus: kein Upload, keine Telemetrie, keine Analytics, keine Cookies. Die einzige Ausnahme ist die OCR. Wenn du sie startest, lädt dein Browser die Modelldateien von dieser Seite. Dein PDF bleibt trotzdem auf deinem Rechner. Du musst mir das nicht glauben. Mach den Netzwerk-Tab in deinen DevTools auf und schau zu.
Projekt unterstützen
Wenn dir dieses kleine Tool Zeit spart, kannst du das Projekt auf zwei Wegen unterstützen.
Option 1: Hostingkosten decken. Du spendierst mir einen virtuellen Kaffee. Das hilft direkt bei den monatlichen Serverkosten und hält die Entwicklung am Laufen.
Option 2: Etwas Sinnvolles tun. Das ist mir fast noch lieber. Als Familienvater liegen mir Projekte für Kinder sehr am Herzen. Wenn du das Tool magst, spende gerne einen kleinen Betrag an das Kinderhaus Weimar.
Andere Projekte
- How To Lose Money Fast: ein Lotterie-Simulator und Analyse-Tool, das zeigt, warum Lottospielen Geld verbrennt.
- DruckZugPro: ein kostenloser Vorab-Check für Schornstein-Querschnittsberechnungen nach DIN EN 13384-1.
- PatioPlanner: Pflasterflächen planen und Steine berechnen.
- Mein Blog: Homelab, Self-Hosting und andere technische Projekte.
- FusePlan: ein kostenloser Planer für Unterverteilungen im Browser. Ziehe Sicherungsautomaten und FI-Schutzschalter auf die Hutschiene und exportiere eine Stückliste.