Benchmarking

Voor Engelstalige literatuur is een vergelijking gemaakt tussen Word Stats en alternatieven met behulp van de eerste vijf alinea's van The Great Gatsby; de tekst is te vinden in Bijlage I. Voor analyse waren deze opgeslagen in een platte tekst file in UTF-8 formaat; elke alinea was een enkele regel tekst, en alinea's waren gescheiden door lege regels. Een paar kleine wijzigingen werden aangebracht in de oorspronkelijke tekst, aangegeven met een vetgedrukt lettertype: twee woorden werden omgezet in getallen (three→3, fifty-one→1851) om de verwerking van getallen te testen; en een afkorting werd halverwege een zin (U.S.) werd toegevoegd om zinssegmentatie (het opsplitsen van tekst in zinnen ) te testen. Voor de analyse werd de primaire taal ingesteld op Amerikaans Engels en werden alle afbreekminima op 2 gezet.

In onderstaande tabel worden de resultaten van Word Stats vergeleken met die van acht websites die gratis online tekstanalyse- of woordentelling aanbieden; de tests werden uitgevoerd op 6 mei 2023. Daarnaast werd een AI-analyse door ChatGPT toegevoegd; zie Bijlage II voor details. Tot slot werden de resultaten verkregen met Microsoft Word toegevoegd, ook al levert dit slechts beperkte statistieken op; Bijlage C bevat enkele opmerkingen.

Om de grondwaarheid te verkrijgen, werd een afzonderlijke handmatige analyse uitgevoerd met behulp van andere programma's, met name Notepad++, Microsoft Excel en Microsoft Calculator. Resultaten die overeenkomen met de grondwaarheid zijn aangegeven in groen; verschillen, zelfs als ze erg klein zijn, worden aangegeven in oranje. Getallen tussen haakjes zijn verkregen door resultaten te combineren. De legenda volgt onder de tabel.

Legenda: 1=Grondwaarheid; 2=`Word Stats`; 3=[readabilityformulas.com](https://readabilityformulas.com/freetests/six-readability-formulas.php); 4=[usingenglish.com](https://www.usingenglish.com/resources/text-statistics/); 5=[lexicool.com](https://www.lexicool.com/text_analyzer.asp); 6=[online-utility.org](https://www.online-utility.org/text/analyzer.jsp); 7=[webtools.services](https://www.webtools.services/text-analyzer); 8=[lumoslearning.com](https://www.lumoslearning.com/llwp/free-text-complexity-analysis.html); 9=[wordcounter.net](https://wordcounter.net/); 10=[wordcount.com](https://wordcount.com/); 11=[ChatGPT 4](https://openai.com/index/gpt-4/); 12=Microsoft Word 365

De belangrijkste discrepantie in de tabel heeft betrekking op het aantal lettergrepen. Dit wordt waarschijnlijk veroorzaakt door het ontbreken van algemeen aanvaarde unieke afbreekregels voor het Engels. Omdat het aantal lettergrepen gebruikt wordt in de berekening van de leesbaarheidsscores, hebben we de resultaten van Word Stats vergeleken met die van verschillende websites voor gratis afbreekanalyse die de volledige afgebroken tekst geven.

Website Lettergrepen
Word Stats 839
hyphenation.one 824
hyphenator.net 824
hyphenation24.com   830
juiciobrennan.com 863
plazoo.com 778

De resultaten van de eerste drie online tools liggen dicht bij die van Word Stats. Handmatige vergelijking van de afgebroken teksten liet zien dat de verschillen voornamelijk (maar niet uitsluitend) voortkomen uit onjuiste verwerking van zogenaamde em-streepjes (—); bijvoorbeeld, het zinsfragment “temperament—it was” produceert lettergrepen tem, pera, ment-it en was in plaats van tem, pera, ment, it en was, wat resulteert in een gemiste lettergreep. De verschillen met de laatste twee websites kunnen voortkomen uit het feit dat deze hulpmiddelen afbrekingsminima van respectievelijk 1 en 3 letters lijken te gebruiken, wat resulteert in meer versus minder lettergrepen. Gebaseerd op deze bevindingen beschouwen we de lettergreeptelling van Word Stats als betrouwbaar.

Bijlage I: Tekst gebruikt voor benchmarking

In my younger and more vulnerable years my father gave me some advice that I’ve been turning over in my mind ever since.

“Whenever you feel like criticizing anyone,” he told me, “just remember that all the people in this world haven’t had the advantages that you’ve had.”

He didn’t say any more, but we’ve always been unusually communicative in a reserved way, and I understood that he meant a great deal more than that. In consequence, I’m inclined to reserve all judgements, a habit that has opened up many curious natures to me and also made me the victim of not a few veteran bores. The abnormal mind is quick to detect and attach itself to this quality when it appears in a normal person, and so it came about that in college I was unjustly accused of being a politician, because I was privy to the secret griefs of wild, unknown men. Most of the confidences were unsought—frequently I have feigned sleep, preoccupation, or a hostile levity when I realized by some unmistakable sign that an intimate revelation was quivering on the horizon; for the intimate revelations of young men, or at least the terms in which they express them, are usually plagiaristic and marred by obvious suppressions. Reserving judgements is a matter of infinite hope. I am still a little afraid of missing something if I forget that, as my father snobbishly suggested, and I snobbishly repeat, a sense of the fundamental decencies is parceled out unequally at birth.

And, after boasting this way of my tolerance, I come to the admission that it has a limit. Conduct may be founded on the hard rock or the wet marshes, but after a certain point I don’t care what it’s founded on. When I came back from the East last autumn I felt that I wanted the world to be in uniform and at a sort of moral attention forever; I wanted no more riotous excursions with privileged glimpses into the human heart. Only Gatsby, the man who gives his name to this book, was exempt from my reaction—Gatsby, who represented everything for which I have an unaffected scorn. If personality is an unbroken series of successful gestures, then there was something gorgeous about him, some heightened sensitivity to the promises of life, as if he were related to one of those intricate machines that register earthquakes ten thousand miles away. This responsiveness had nothing to do with that flabby impressionability which is dignified under the name of the “creative temperament”—it was an extraordinary gift for hope, a romantic readiness such as I have never found in any other person and which it is not likely I shall ever find again. No—Gatsby turned out all right at the end; it is what preyed on Gatsby, what foul dust floated in the wake of his dreams that temporarily closed out my interest in the abortive sorrows and short-winded elations of men.

My family have been prominent, well-to-do people in this Middle Western U.S. city for 3 generations. The Carraways are something of a clan, and we have a tradition that we’re descended from the Dukes of Buccleuch, but the actual founder of my line was my grandfather’s brother, who came here in 1851, sent a substitute to the Civil War, and started the wholesale hardware business that my father carries on today.

Bijlage II: ChatGPT analyze

Het bestand met de eerste vijf paragrafen van The Great Gatsby dat werd gebruikt voor de andere analyses werd op 30 oktober 2024 geüpload naar OpenAI's ChatGPT 4.0, dat vervolgens werd gevraagd:

“Wat zijn in het zojuist geüploade UTF-8 tekstbestand het aantal regels, alinea's, zinnen, woorden, unieke woorden, getallen, lettergrepen, bytes, tekens, letters, cijfers en spaties, en wat is het gemiddelde aantal tekens per woord, het gemiddelde aantal lettergrepen per woord, het gemiddelde aantal woorden per zin en het gemiddelde aantal zinnen per alinea?”

ChatGPT voerde vervolgens een analyse uit waarvan de resultaten zijn opgenomen in bovenstaande tabel. Hoewel deze resultaten van een platform voor algemene doeleinden behoorlijk indrukwekkend zijn, zijn ze niet 100% correct. Gebruik AI-platforms daarom, net als alle andere tools, met zorg.

Bijlage C. Microsoft Word-analyse

Het bestand met de eerste vijf alinea's van The Great Gatsby dat voor de andere analyses werd gebruikt, werd geopend in Microsoft Word 365. De statistieken verkregen door te dubbelklikken op het aantal woorden linksonder werden toegevoegd aan bovenstaande tabel. Ze zijn allemaal correct, behalve het aantal regels. Dit laatste verschilt om voor de hand liggende redenen: Word Stats telt het aantal nieuweregelkarakters terwijl Word het aantal regels telt dat zichtbaar is op het scherm; dat laatste hangt af van het geselecteerde lettertype. Het aantal spaties werd berekend door het aantal karakters zonder spaties af te trekken van het totaal aantal karakters.

Omdat het aantal woorden in Microsoft Word de de facto metriek is die door veel schrijvers wordt gebruikt, hebben we wat nader gekeken door de volledige tekst van The Great Gatsby te analyseren; deze werd gebruikt om de resultaten te verkrijgen die zijn gerapporteerd in de gebruikershandleiding. Het bestand werd handmatig gescheiden in tokens die vervolgens werden opgeschoond volgens het Word Stats algoritme; dit leverde 48.406 tokens op. Verdere inspectie toonde aan dat deze 10 getallen bevatte. De Word Stats analyse van deze tekst rapporteerde 48.386 woorden en 10 getallen. Als we de grondwaarheid, Word Stats' woorden + getallen en Microsoft Word's woordentelling vergelijken, krijgen we:

Bron  Telling  Verschil
Grondwaarheid   48.406   n.v.t.
Word Stats   48.396   -10 (0,021%)
Microsoft Word   48.489   +83 (0,171%)

Nadere inspectie toonde aan dat de tekst 16 tokens bevat die ofwel tijden (9:00) ofwel rangtelwoorden (158th) zijn. Word Stats herkent deze op dit moment niet als woord of getal en voegt ze toe aan de unieke niet-woorden lijst. Als ze als woorden zouden worden geteld dan zou het verschil met de grondwaarheid +6 (0,012%) zijn.

In conclusie: hoewel zowel de woordentelling van Microsoft Word als die van Word Stats dicht bij de grondwaarheid liggen, wijkt de eerste er meer van af dan de laatste. De woordentelling van Word Stats kan bovendien verder verfijnd worden.