Benutzerhandbuch

Hintergrund

Nachdem ich 2018 ein umfangreiches Dokument fertiggestellt hatte, interessierten mich zwei bestimmte Statistiken: Wie viele unterschiedliche Wörter enthielt es, und wie häufig kam jedes dieser Wörter vor? Außerdem wollte ich genau wissen, um welche Wörter es sich handelte. Schließlich sollte die Analyse zwei verschiedene Sprachen erkennen und die Wörter beider Sprachen unterscheiden können.

Ich hatte mein Dokument in Microsoft® Word geschrieben. Word kann einige grundlegende Dokumentstatistiken liefern, etwa die Anzahl der Seiten, Wörter, Zeichen, Absätze und Zeilen. Das war zwar interessant, entsprach aber nicht dem, was ich suchte. Nachdem ich online kein passendes Werkzeug gefunden hatte, entwickelte ich selbst eines. Ich nannte es Word Stats, weil ich Statistiken über mein Word-Dokument ermitteln wollte. Die erste Analyse in meiner Software war jedoch extrem langsam. Als Optimierungsversuche keine ausreichende Verbesserung brachten, konzentrierte ich mich stattdessen auf die Analyse von reinen Textdateien - mit sehr guten Ergebnissen.

Word Stats ist als Windows-App und als die hier verwendete Web-App verfügbar; beide sind kostenlos. Dieses Handbuch beschreibt die Web-App.

Oberflächensprache

Die Oberflächensprache, also die Sprache und das Gebietsschema der Website, wird im Sprachmenü oben auf der Seite ausgewählt. Öffnen Sie das Menü und wählen Sie English, Nederlands, Deutsch oder Español. Nach der Auswahl kehren Sie zur Startseite zurück und die Oberfläche wird sofort aktualisiert. Es empfiehlt sich, die gewünschte Oberflächensprache vor einer Analyse auszuwählen.

Dateiauswahl

Word Stats verarbeitet ausschließlich reine Textdateien; Einzelheiten finden Sie in Anhang A. Die zu analysierende Datei muss die Erweiterung .txt besitzen und kann auf der Startseite ausgewählt und hochgeladen werden.

Optionen

Nach dem Hochladen einer Datei wird eine neue Seite mit den Einstellungen für die Analyse geöffnet.

  • Primäre und optionale sekundäre Analysesprache. Word Stats unterstützt zweisprachige Analysen und kann dadurch gleichzeitig Wörter aus zwei verschiedenen Sprachen erkennen. Als Analysesprachen stehen Deutsch, Englisch, Französisch, Italienisch, Niederländisch, Portugiesisch und Spanisch zur Verfügung. Je nach Gebietsschema werden unterschiedliche Funktionen unterstützt, wie die folgende Übersicht zeigt.

    Die voreingestellte primäre Analysesprache folgt der Oberflächensprache: Englisch (USA), Niederländisch (Niederlande), Deutsch (Deutschland) oder Spanisch. Sie kann jederzeit geändert werden. Hinweis: In der Windows-App von Word Stats können zusätzliche Sprachen installiert werden.

  • Einstellungen für die Silbentrennung. Regeln für die Silbentrennung unterscheiden sich nach Sprache und Gebietsschema und können teilweise angepasst werden. Insbesondere lässt sich die Mindestzahl der Buchstaben vor dem ersten und nach dem letzten Trennstrich getrennt für zusammengesetzte und nicht zusammengesetzte Wörter einstellen. Wenn die ausgewählte Sprache dies unterstützt, wird der Standardwert angezeigt und kann auf 2 oder 3 gesetzt werden. Andernfalls sind die Auswahlfelder deaktiviert. Wenn Sie unsicher sind, behalten Sie die Standardwerte bei.

  • Wortregeln. Die Annahme oder Ablehnung von Wörtern durch die integrierte Rechtschreibprüfung kann überschrieben werden. Dazu geben Sie Listen mit Wörtern ein, die unabhängig vom Ergebnis der Rechtschreibprüfung akzeptiert oder abgelehnt werden sollen. Die Schaltfläche mit den Auslassungspunkten (...) hinter Zu akzeptierende Wörter und Abzulehnende Wörter öffnet oder schließt das jeweilige Textfeld. In jeder Zeile darf nur ein Wort stehen; zulässig sind Buchstaben, Bindestriche und ein Apostroph. Ungültige und leere Zeilen werden ignoriert. Steht ein Wort in beiden Listen, wird es akzeptiert. Groß- und Kleinschreibung werden in den Listen nicht unterschieden.

  • Dezimal- und Tausendertrennzeichen. Diese Zeichen unterscheiden sich je nach Sprache. Beispielsweise wird 1,234,567.89 im Deutschen als 1.234.567,89 geschrieben. Die Voreinstellung richtet sich nach der gewählten primären Sprache, kann aber geändert werden.

  • Optionale Analysen.

    • Fußnoten verarbeiten: Word Stats versucht Fußnotenverweise zu erkennen und aus der Zahlenstatistik auszuschließen.
    • Hyperlinks verarbeiten: Hyperlinks werden erkannt und gezählt, aus dem Text entfernt und als eindeutige Hyperlinks gespeichert.
    • Inhaltsverzeichnis verarbeiten: Zeilen eines Inhaltsverzeichnisses werden erkannt und enthaltene Seitenzahlen aus der Zahlenstatistik ausgeschlossen. Diese Funktion ist nur verfügbar, wenn Englisch die primäre Sprache ist.
Analyse

Nach dem Hochladen der Datei und dem Festlegen der Optionen starten Sie den Auftrag mit Analyse starten. Wenn bereits Analysen anderer Benutzer ausgeführt werden, wartet Ihr Auftrag; die Zahl der vor Ihnen liegenden Aufträge wird angezeigt. Sobald die Verarbeitung beginnt, erscheint Analyse läuft. Die Analyse dauert normalerweise nur wenige Sekunden. Anschließend wird die Ergebnisseite geöffnet.

Anhang B beschreibt den Analysealgorithmus von Word Stats im Detail.

Ergebnisse

Die Ergebnisseite fasst die während der Analyse ermittelten Statistiken zusammen. Die folgende Abbildung zeigt die Analyse des vollständigen Textes von The Great Gatsby mit den Standardeinstellungen.

Bei den Lesbarkeitskennzahlen führen Links zu den entsprechenden Wikipedia-Artikeln.

Die Statistik kann als statistik.csv heruntergeladen werden. Weitere CSV-Dateien enthalten Detaildaten und lassen sich beispielsweise in Microsoft® Excel öffnen. Die ersten zehn Zeilen von eindeutige L1-Wörter.csv, absteigend nach Silben und danach nach Länge sortiert, sehen so aus:

Dieselben Daten, zuerst absteigend nach Länge und danach alphabetisch nach Wort sortiert:

Die zehn häufigsten Wörter, absteigend nach Anzahl sortiert:

Die ersten Zeilen von eindeutige andere Wörter.csv, absteigend nach Länge und danach nach Silben sortiert, zeigen Wörter, die nicht als gültige englische Wörter erkannt wurden:

Solche Wörter können durch Aufnahme in die Akzeptieren-Liste erkannt und gezählt werden.

Aus eindeutige L1-Wörter.csv lassen sich beispielsweise mit Microsoft® Excel auch Diagramme wie diese erzeugen:

Für eine weitere Analyse wählen Sie einfach Startseite.

Diskussion

Word Stats wurde ursprünglich für Microsoft®-Word-Dokumente entwickelt, die als reiner Text gespeichert wurden. Obwohl zweisprachige Analysen und mehrere vorinstallierte Sprachen und Gebietsschemas unterstützt werden, wurde das Programm hauptsächlich mit Englisch (USA) und Niederländisch (Niederlande) getestet. Wie gut sich die Analyse auf Textdateien aus anderen Quellen sowie auf andere Sprachen und Gebietsschemas übertragen lässt, wurde nicht umfassend untersucht. Die App wird in der Hoffnung angeboten, dass sie dennoch nützlich ist.

Word Stats ist für die Analyse mehr oder weniger vollständiger Dokumente vorgesehen und kein Rechtschreibprüfprogramm. Die erzeugten Wortlisten, insbesondere Andere Wörter und Nichtwörter, können dennoch interessante Hinweise liefern. Diese Einsichten führten zu verschiedenen Verbesserungen des mehrsprachigen Referenzdokuments, das für Tests verwendet wird.

Ein interessanter Nebeneffekt besteht darin, ein Dokument in einer anderen Sprache zu analysieren als derjenigen, in der es geschrieben wurde. Beim englischen Fragment von The Great Gatsby werden beispielsweise 5.701 eindeutige Wörter in der englischen Analyse erkannt, 1.112 in einer französischen und 1.158 in einer niederländischen Analyse.

Anhang A. Vorbereitung einer Textdatei

Textdateien können auf viele Arten erstellt werden. Word Stats wurde vor allem für Microsoft®-Word-Dokumente entwickelt, die als reine Textdateien exportiert werden. Öffnen Sie dazu ein Word-Dokument, wählen Sie Datei --> Speichern unter (oder Kopie speichern) und anschließend oben im Auswahlfeld Nur Text (.txt). Nach Speichern wird das folgende Dialogfeld angezeigt:

Gute Ergebnisse werden erzielt, wenn Andere Codierung und anschließend Unicode (UTF-8) ausgewählt werden, wie in der folgenden Abbildung.1

Word wandelt jeden Absatz in eine einzelne Textzeile um. Dieses Format verwendet Word Stats für die Zählung von Absätzen. Fußnotennummern werden beispielsweise von Beispiel.12 in Beispiel.12 umgewandelt, wobei der Punkt auch ein anderes Satzzeichen sein kann. Word Stats kann diese Zahlen - die jeweils einmal als Verweis und einmal beim Fußnotentext auftreten - erkennen und aus der Zahlenstatistik ausschließen. Entsprechend können auch Zahlen eines Inhaltsverzeichnisses erkannt und ignoriert werden.

Natürlich gibt es viele andere Möglichkeiten, eine Textdatei zu erstellen. Benutzer müssen selbst sicherstellen, dass die hochgeladene Datei tatsächlich den zu analysierenden Inhalt enthält. Hinweise zu PDF-Dateien finden Sie unter Hilfe/PDF in Text.

  1. Mithilfe der Bibliothek Ude.NetStandard erkennt und unterstützt Word Stats die folgenden Textcodierungen beziehungsweise Zeichenformate: ASCII, UTF-8, UTF-16 in Big und Little Endian sowie UTF-32 in Little Endian.
Anhang B. Analysealgorithmus

Die Analyse von Word Stats läuft folgendermaßen ab.

  1. Der Text wird an Zeilenumbrüchen in Zeilen aufgeteilt. Unterstützt werden Windows- (CR LF), Unix- (LF) und macOS-Formate (CR). Jede Zeile wird anschließend wie folgt verarbeitet.
  2. Leere Zeilen werden ignoriert.
  3. Zeichen, Buchstaben, Ziffern, Leerzeichen und Tabulatoren der Zeile werden gezählt.
  4. Jede nicht leere Zeile wird als neuer Absatz gezählt.
  5. Wenn Inhaltsverzeichnis verarbeiten aktiviert ist, wird geprüft, ob die Zeile zu einem Inhaltsverzeichnis gehört. Ein Inhaltsverzeichnis beginnt mit dem Text Table of Contents und läuft weiter, solange die folgenden Zeilen mit einer ganzen Zahl enden. Die Verarbeitung bewirkt, dass diese Seitenzahlen nicht als Zahlen gezählt werden. Diese Funktion ist derzeit nur für Englisch als primäre Sprache verfügbar.
  6. Wenn Hyperlinks verarbeiten aktiviert ist, werden Hyperlinks erkannt, aus der Zeile entfernt, gezählt und neue Adressen in einer Liste gespeichert. Ein Hyperlink ist eine Zeichenfolge ohne Tabulatoren oder Leerzeichen, die auf einen Punkt und eine Top-Level-Domain endet, optional gefolgt von einem Schrägstrich und anschließend einem Leer- oder Satzzeichen (, . : ; ! ? ...). Berücksichtigt werden .com, .edu, .gov, .net, .org und alle 247 Länderdomains. Gültige Beispiele sind microsoft.com und https://www.sunnysideupsoftware.com/.
  7. Wenn Fußnoten verarbeiten aktiviert ist, werden Fußnotennummern gesucht, gezählt, aus der Zeile entfernt und in einer Liste gespeichert. Sie bestehen aus einem Satzzeichen, einer ganzen Zahl und einem folgenden Leerzeichen oder Zeilenende, beispielsweise .6 oder ;7 . Word Stats stellt sicher, dass es sich nicht um einen Teil einer regulären Zahl wie 12.6 handelt. Erkannte Fußnotenverweise werden nicht als Zahlen gezählt.
  8. Die Zeile wird bereinigt, indem
    1. Zeichen mit der Breite null entfernt werden, beispielsweise Trennstriche oder Leerzeichen mit der Breite null;
    2. satzabschließende Zeichen außer dem Punkt (? ! ...) durch einen Punkt ersetzt werden;
    3. Punkte vor einem doppelten Anführungszeichen durch einen Punkt ersetzt werden, um die Satzerkennung zu unterstützen;
    4. besondere Leerzeichen, etwa schmale Leerzeichen, durch normale Leerzeichen ersetzt werden;
    5. Schrägstriche und Tabulatoren durch Leerzeichen ersetzt werden, sodass beispielsweise ja/nein als zwei Wörter verarbeitet wird;
    6. andere Striche als Bindestriche, etwa geschützte Bindestriche, Halbgeviert- und Geviertstriche, durch einen von Leerzeichen umgebenen Bindestrich ersetzt werden;
    7. mehrere aufeinanderfolgende Leerzeichen durch ein einzelnes Leerzeichen ersetzt werden.
  9. Die Zeile wird in Sätze aufgeteilt. Diese Satzgrenzenerkennung ist anspruchsvoll, insbesondere wegen Abkürzungen mit Punkten. Eine einfache Trennung an jedem Punkt mit nachfolgendem Leerzeichen würde beispielsweise „Prof. Dr. XYZ wurde im Vereinigten Königreich geboren, lebt aber seit 2010 in den USA.“ als mehrere Sätze zählen. Word Stats verwendet PragmaticSegmenterNet, eine C#-Portierung von Pragmatic Segmenter, für eine hochwertige regelbasierte mehrsprachige Satzgrenzenerkennung. PragmaticSegmenterNet unterstützt nicht alle Sprachen und Gebietsschemas von Word Stats; siehe die Tabelle oben. Wenn möglich, werden die Regeln der primären Sprache verwendet. Andernfalls werden Satzstatistiken deaktiviert.
  10. Jeder gegebenenfalls veränderte Satz wird in Tokens aufgeteilt, also durch Leerzeichen getrennte Zeichenfolgen. Diese Tokens werden anschließend wie folgt verarbeitet.
  11. Ein Token ohne Zeichen erhöht die Zahl der Leeren Tokens.
  12. Ein nicht leeres Token wird bereinigt, indem 1. typografische Apostrophe (‘ und ’) durch gerade Apostrophe (') ersetzt werden; 2. die Zeichen " “ ” ¡ ! ¿ ? : ; . , … ( ) [ ] { } entfernt werden; 3. führende und nachgestellte Bindestriche und Apostrophe entfernt werden. Bindestrichwörter wie brother-in-law und Apostrophe in Wörtern wie she's bleiben erhalten.
  13. Es wird geprüft, ob das Token eine gültige Zahl ist. In diesem Fall wird Zahlen erhöht und eine neue Zahl in der Liste gespeichert. Danach folgt das nächste Token.
  14. Ist das Token keine Zahl, wird eine kleingeschriebene Kopie erzeugt.
  15. Es wird geprüft, ob diese Kopie ein gültiges Wort ist: eine Folge von Buchstaben mit beliebig vielen Bindestrichen und höchstens einem Apostroph. Kontraktionen wie didn't oder it's zählen als ein Wort.
  16. Jedes gültige Wort wird wie folgt verarbeitet: 1. Die Gesamtzahl der Wörter und die Zahl der Wörter pro Satz werden erhöht. 2. Wenn das Wort mehr als ein Zeichen hat und seine ursprüngliche oder kleingeschriebene Form die Rechtschreibprüfung der primären Sprache besteht oder in deren Akzeptieren-Liste steht, ohne in der Ablehnen-Liste zu stehen, beziehungsweise wenn ein einzelnes Zeichen in der Akzeptieren-Liste steht: 1. Das Wort wird als Wort der primären Sprache gezählt. 2. Ein neues Wort wird in deren Liste der Eindeutigen Wörter aufgenommen. 3. Wörter ohne Bindestrich werden als Wörter ohne Trennstrich, andere als getrennte Wörter der primären Sprache gezählt. 4. Die Silbenzahl wird mit der Silbentrennung von NHunspell bestimmt. Bei Wörtern mit Bindestrichen werden die Bestandteile einzeln analysiert. Das Ergebnis wird zur Gesamtzahl der Silben addiert. 5. Die Statistiken Zeichen pro Wort und Silben pro Wort werden aktualisiert. 3. Andernfalls wird Schritt 16.2 für die sekundäre Sprache wiederholt, sofern eine ausgewählt wurde. 4. Wird das Wort in keiner Sprache erkannt und hat es mindestens zwei Zeichen, wird Schritt 16.2 für Andere Wörter wiederholt.
  17. Ist das Token weder eine Zahl noch ein gültiges Wort, wird Andere Tokens erhöht und ein neues Token in der Liste der eindeutigen Tokens gespeichert.
  18. Am Ende jedes Satzes werden die Statistiken Sätze, Wörter pro Satz und Sätze pro Absatz aktualisiert. Ein Satz kann aus nur einem Wort bestehen.
  19. Am Ende jeder Zeile wird die Absatzstatistik aktualisiert. Ein Absatz kann aus nur einem Satz bestehen.
  20. Nachdem alle Zeilen verarbeitet wurden, wird bei aktivierter Fußnotenverarbeitung die Häufigkeit jeder in der Fußnotenliste enthaltenen Zahl in der Liste Eindeutige Zahlen um eins reduziert. Einträge mit null Vorkommen werden entfernt.
  21. Wenn Englisch die primäre Sprache ist und keine sekundäre Sprache gewählt wurde, werden die Lesbarkeitskennzahlen berechnet.
  22. Ausgewählte Ergebnisse werden als kommagetrennte Dateien (.csv) gespeichert. Die Datei Eindeutige Nichtwörter beziehungsweise andere Tokens wird stattdessen tabulatorgetrennt (.tsv) gespeichert, da Tokens Kommas enthalten können, die das CSV-Format stören würden.