PDF naar Tekst
Introductie
Word Stats is specifiek gericht op het analyseren van platte tekstbestanden, maar documenten zijn er in veel verschillende formaten. Adobe's PDF (Portable Document Format) is een bekende en handige manier om vele soorten documenten te representeren. We hebben geëxperimenteerd met het intern omzetten van PDF-bestanden naar platte tekst die het analysealgoritme kan verwerken. Maar terwijl platte tekst zeer beperkte opties voor tekstopmaak biedt - in wezen alleen spaties, tabs en regeleinden - biedt PDF zeer veel flexibiliteit in dit opzicht, waarbij tekstblokken en kolommen, afbeeldingen, tabellen, grafieken, enz. mogelijk zijn. Dit maakt nuttige conversie naar platte tekst uitdagender dan het lijkt; zelfs betrouwbaar herstel van een eenvoudig platte tekst document zoals The Great Gatsby geconverteerd naar PDF is lastig. Daarom hebben we besloten om de conversie van PDF naar platte tekst over te laten aan commerciële of niet-commerciële tools die online te vinden zijn.
Eén zo'n tool is Microsoft® Word, onderdeel van de Microsoft 365 productiviteitssuite, dat we als voorbeeld zullen gebruiken. Een PDF-bestand kan worden geopend in Word via Bestand --> Openen --> Browse, waarbij PDF wordt geselecteerd in de vervolgkeuzelijst, wordt gebladerd naar het bestand dat je wilt converteren en vervolgens wordt geklikt of getikt op Openen. Word opent nu het bestand en converteert het naar bewerkbare tekst, wat een paar seconden kan duren. Dit bestand kan nu opgeslagen worden als een tekstbestand volgens de procedure beschreven in Appendix A van de Gebruikshandleiding. Zorg ervoor dat het Unicode (UTF-8) formaat wordt gebruikt, net als in de originele file.
Voorbeeld
Ter illustratie beschrijven we nu hoe het platte tekstbestand van The Great Gatsby werd gemaakt, geconverteerd naar PDF, terug geconverteerd naar tekst en geanalyseerd. Merk op dat het auteursrecht op dit boek in januari 2021 is verlopen, waarna het in het publieke domein kwam.
Het tekstbestand werd gemaakt door de tekst van de hoofdstukken I ... IX -- te vinden op de Toronto Metropolitan University Pressbooks -- hoofdstuk voor hoofdstuk handmatig te kopiëren en in een platte teksteditor (Microsoft® Kladblok) te plakken. Hoewel The Great Gatsby op veel plaatsen op het internet te vinden is, heeft deze specifieke bron het voordeel dat elke paragraaf is opgeslagen als een enkele regel tekst, zoals vereist voor Word Stats; bovendien zijn er geen paginanummers. Om de vergelijking met de originele tekst te ondersteunen, zijn er een paar bewerkingen gemaakt om de gedownloade tekst terug te zetten van Canadees naar Amerikaans Engels (en_CA naar en_US):
- Verander ou in o in: behaviour, clamour, coloured, favour, flavoured, honour, moulding, neighbour, neighbourhood, odour, parlour, rancour, rumour, savoury, smouldering, splendour, valour
- Verander ll in l in: dishevelled, marvelled, marvelling, marvellous, panelled, parcelled, signalled
- Verander re in er in: centrum, glansloos, somber
- Verander s in z in: verlamd
- Verander c in s in: verdediging, voorwendsels
- Verander c in k in: sceptisch, scepticisme
- Verander aluminium in aluminium, juwelen in sieraden, pyjama in pyjama
Dit leverde het platte tekstbestand op dat is gebruikt voor het verkrijgen van de resultaten die worden gerapporteerd in de Gebruikshandleiding. Dat bestand werd vervolgens geconverteerd naar PDF door het vanuit Kladblok naar de Microsoft Print to PDF printer te sturen. Het resulterende PDF-bestand werd vervolgens weer omgezet naar platte tekst zoals hierboven beschreven en geanalyseerd in Word Stats. De tabel hieronder vergelijkt de analyseresultaten van het originele bestand en het bestand hersteld van PDF.

Discussie
Alinea's in het originele document worden in het PDF-bestand opgesplitst in meerdere regels. Als je dat bestand opent in (bijvoorbeeld) Adobe Acrobat, de eerste twee alinea's selecteert, kopieert en in een tekstverwerker plakt, krijg je het volgende resultaat:
In mijn jongere en meer kwetsbare jaren gaf mijn vader me een advies dat ik sindsdien
dat ik sindsdien in mijn hoofd heb.
“Als je het gevoel hebt dat je iemand wilt bekritiseren,” vertelde hij me, “bedenk dan dat alle
mensen in deze wereld niet de voordelen hebben gehad die jij hebt gehad.”
Hier kunnen we twee dingen opmerken:
- Beide alinea's, elk een enkele regel in het originele tekstbestand, zijn opgesplitst in twee regels.
- De lege regel die de alinea's in het oorspronkelijke bestand scheidde, is verdwenen.
Het eerste punt betekent dat als de volledige tekst op deze manier van PDF naar tekst zou worden geconverteerd, het aantal regels veel hoger zou worden dan in het origineel. Omdat Word Stats verwacht dat elke alinea op een eigen regel staat, zou het aantal alinea's ook veel hoger zijn. Het tweede punt betekent dat lege regels niet gebruikt kunnen worden om alineagrenzen te herstellen, en vermindert ook het aantal regels.
Gelukkig herstelt Word's conversie van PDF naar tekst in alinea's, hetgeen betekent dat de gefragmenteerde alinea's weer worden samengevoegd tot één regel. De lege regel tussen twee alinea's wordt echter niet hersteld.
We kunnen zien dat i) de meeste elementen in de vergelijking hierboven dicht bij elkaar liggen en ii) het aantal regels nogal verschilt. Dit laatste is het gevolg van het verwijderen van lege regels. Het aantal bytes zou ook dichter bij elkaar liggen als lege regels behouden zouden blijven, aangezien elke lege regel uit twee tekens bestaat (een carriage return <CR> en een line feed <LF>). Een verklaring voor alle kleine verschillen zou een diepere analyse vereisen die we niet hebben uitgevoerd.
Conclusie
Zelfs hoogwaardige conversie van een tekstdocument met weinig opmaak, geen paginanummers, geen kop- of voetteksten, geen inhoudsopgave, geen voetnoten en geen hyperlinks, naar PDF en weer terug naar tekst introduceert veranderingen ten opzichte van het oorspronkelijke document. Dit doet me denken aan dubbele wijsheid die ik lang geleden heb geleerd, tijdens een stage die ik liep als onderdeel van mijn MS-diploma: meten is weten, maar weet wat je meet. In de huidige context verwijst meten naar het gebruik van Word Stats om een tekstdocument te analyseren, terwijl weten wat je meet aangeeft om ervoor te zorgen dat het te analyseren document zo dicht mogelijk ligt bij wat je wilt dat het is. Het is daarom sterk aan te raden om een document dat verkregen is door PDF-conversie te controleren en indien nodig op te schonen alvorens het te analyseren.