Methodik
Methodik und Quellen
docxtxt.de wandelt Word-DOCX-Dateien lokal im Browser in reinen Text um. Die Verarbeitung läuft komplett auf Deinem Gerät, kein Server sieht die Datei. Diese Seite erklärt, wie das Tool intern arbeitet und worauf wir achten.
Die mammoth.js-Pipeline
Wir nutzen die Bibliothek mammoth.js (Browser-Build), eine etablierte Open-Source-Lösung zum Lesen von Word-Dokumenten. Der Ablauf in drei Schritten:
- Entpacken: Eine DOCX ist ein ZIP-Archiv aus XML-Dateien. mammoth entpackt es im Arbeitsspeicher des Browsers, ganz ohne Server.
- Auslesen: Aus
word/document.xmlwerden die Textknoten (w:t) gelesen, Absätze bleiben als Zeilen erhalten. Wie das im Detail aussieht, zeigt der Ratgeber Wie eine DOCX aufgebaut ist. - Ausgeben: Über
extractRawTexterhalten wir reinen Text, den wir normalisieren (Rand-Leerzeilen entfernen) und als UTF-8 zum Kopieren und als .txt-Download bereitstellen.
Was bewusst verloren geht
Reiner Text kennt keine Formatierung. Schriftarten, Farben, Bilder, Kopf- und Fußzeilen und Spaltensatz fallen weg, Tabellen werden zu aufeinanderfolgenden Zeilen linearisiert. Das ist kein Fehler, sondern der Sinn der Umwandlung. Welche Wege es zum Textextrakt gibt, vergleicht Text aus Word extrahieren.
Metadaten und Datensparsamkeit
Eine DOCX trägt oft versteckte Metadaten mit sich: Autornamen, Kommentare, Änderungsverlauf. Beim Extrahieren des reinen Textes bleiben diese außen vor. Warum das ein handfester Datenschutzvorteil ist, ordnet Datenschutz bei Dokument-Konvertern ein.
Text-Metriken
Nach der Umwandlung zeigen wir Wortzahl, Zeichenzahl und Absatzzahl an. Die Wortzahl trennt an Whitespace, die Absatzzahl zählt durch Leerzeilen getrennte Blöcke. Kann mammoth ein Element nicht abbilden, weisen wir die Zahl der Hinweise offen aus, statt sie zu verstecken.
Grenzen: nur .docx
Das Tool liest ausschließlich das moderne .docx-Format (Office Open XML). Das alte binäre .doc-Format wird nicht unterstützt, es müsste zuerst in Word als .docx gespeichert werden.
Privacy-Architektur
Wir verarbeiten Deine Datei nur lokal im Browser. Die DOCX wird zu einem
ArrayBuffer gelesen, von mammoth entpackt und der Text zurückgegeben. Es gibt keinen
fetch an unsere Server, keine Hintergrund-Synchronisation, kein Logging Deiner
Inhalte. Im DevTools Netzwerk-Tab siehst Du genau das.
Was wir an Telemetrie sehen
Wenn Du dem Cookie-Banner zustimmst, lädt unser Tool zwei Drittanbieter-Skripte: Adition (Werbung) und optional Umami (cookielose Reichweitenmessung). Beide sehen nichts über Deine Datei, weil sie den Browser nie verlässt. Sie sehen den Seitenaufruf, die Verweildauer und grobe Geräte-Daten.
Quellen
- mammoth.js (die verwendete Bibliothek, extractRawText).
- ECMA-376: Office Open XML (das DOCX-Dateiformat).
- MDN: Zeichenkodierung (UTF-8, reiner Text).
- The Unicode Standard (Zeichen und Umlaute).
Review-Zyklus
Die Ratgeber und Pflicht-Pages werden halbjährlich gegen aktuelle Quellen geprüft. Änderungen landen mit Datum und Begründung unter /korrekturen. Tippfehler und kleinere Präzisierungen machen wir still im Hintergrund.
Was docxtxt.de NICHT ist
docxtxt.de ist kein Dokument-Editor und kein Format-Wandler mit Layout-Erhalt. Wir ziehen den reinen Text heraus, mehr nicht. Wer DOCX nach PDF, Markdown oder HTML mit Formatierung wandeln will, braucht andere Werkzeuge wie pdfkonvertieren.de, LibreOffice oder Pandoc.