Manual de usuario
Antecedentes
Después de terminar un documento importante en 2018, sentí curiosidad por dos estadísticas concretas: cuántas palabras diferentes contenía y con qué frecuencia aparecía cada una. También quería saber exactamente cuáles eran esas palabras. Por último, necesitaba que el análisis reconociera dos idiomas distintos y diferenciara las palabras de cada uno.
Había escrito el documento en Microsoft® Word, que ofrece algunas estadísticas básicas, como el número de páginas, palabras, caracteres, párrafos y líneas. Aunque eran interesantes, no era lo que buscaba. Tras buscar herramientas en Internet sin encontrar ninguna adecuada, decidí crear la mía. La llamé Word Stats, porque buscaba estadísticas sobre mi documento de Word. Sin embargo, el primer análisis con mi programa fue extremadamente lento. Como los intentos de optimización no dieron suficiente resultado, decidí centrarme en analizar archivos de texto sin formato, con resultados muy satisfactorios.
Word Stats está disponible como aplicación para Windows y como la aplicación web que está utilizando; ambas son gratuitas. Este manual explica el funcionamiento de la aplicación web.
Idioma de la interfaz
El idioma de la interfaz, es decir, el idioma y la configuración regional utilizados por el sitio web, se selecciona en el menú de idiomas situado en la parte superior de la página. Abra el menú y elija English, Nederlands, Deutsch o Español. Al seleccionar un idioma volverá a la página de inicio y la interfaz se actualizará inmediatamente. Se recomienda elegir el idioma deseado antes de realizar un análisis.
Selección del archivo
Por diseño, Word Stats trabaja exclusivamente con archivos de texto sin formato; consulte el apéndice A. El archivo que se analizará debe tener la extensión .txt y puede seleccionarse y subirse desde la página de inicio.
Opciones
Después de subir un archivo se abre una página con varias opciones para controlar el análisis.
Idioma principal e idioma secundario opcional.
Word Statsadmite análisis bilingües, por lo que puede reconocer simultáneamente palabras de dos idiomas. Los idiomas de análisis disponibles son alemán, español, francés, inglés, italiano, neerlandés y portugués. Las funciones admitidas varían según la configuración regional, como muestra la siguiente tabla.
El idioma principal predeterminado sigue al idioma de la interfaz: inglés (Estados Unidos), neerlandés (Países Bajos), alemán (Alemania) o español. Puede cambiarse cuando sea necesario. Nota: la aplicación
Word Statspara Windows permite instalar idiomas adicionales.Configuración de división silábica. Las reglas varían según el idioma y la configuración regional y, en algunos casos, pueden modificarse. En concreto, puede configurarse por separado el número mínimo de letras antes del primer guion y después del último para palabras compuestas y no compuestas. Si el idioma seleccionado lo permite, se muestra el valor predeterminado y puede elegirse 2 o 3. En caso contrario, los controles aparecen desactivados. Si no sabe si debe modificar estos valores, conserve la configuración predeterminada.
Reglas de palabras. Puede anular la aceptación o el rechazo de palabras por parte del corrector ortográfico integrado. Para ello, introduzca listas de palabras que deban aceptarse o rechazarse con independencia del resultado del corrector. El botón de puntos suspensivos (...) situado junto a Palabras que se aceptarán y Palabras que se rechazarán abre o cierra el cuadro de texto correspondiente. Debe escribirse una palabra por línea y solo se permiten letras, guiones y un apóstrofo. Las líneas no válidas y las vacías se ignoran. Si una palabra aparece en ambas listas, se acepta. Las listas no distinguen entre mayúsculas y minúsculas.
Separadores decimal y de miles. Estos caracteres varían según el idioma. Por ejemplo, 1,234,567.89 se escribe 1.234.567,89 en español. Los separadores predeterminados dependen del idioma principal seleccionado, pero pueden cambiarse.
Análisis opcionales.
- Procesar notas al pie:
Word Statsintenta reconocer las referencias a notas al pie y excluirlas del recuento de números. - Procesar hipervínculos: detecta y cuenta los hipervínculos, los elimina del texto y almacena los nuevos en la lista de hipervínculos únicos.
- Procesar tabla de contenido: comprueba si una línea pertenece a la tabla de contenido y excluye sus números de página del recuento. Esta función solo está disponible cuando el inglés es el idioma principal.
- Procesar notas al pie:
Análisis
Después de subir el archivo y configurar las opciones, pulse Iniciar análisis. Si se están ejecutando análisis de otros usuarios, su trabajo esperará; se muestra el número de trabajos que tiene por delante. Cuando comience el procesamiento aparecerá Analizando. Normalmente solo tarda unos segundos y, al terminar, se abre la página de resultados.
El apéndice B describe detalladamente el algoritmo de análisis de Word Stats.
Resultados
La página de resultados resume las estadísticas obtenidas. La siguiente imagen muestra el análisis del texto completo de The Great Gatsby con la configuración predeterminada.

Las métricas de legibilidad incluyen enlaces a los artículos correspondientes de Wikipedia.
Las estadísticas pueden descargarse como estadísticas.csv. Otros archivos CSV contienen datos detallados y pueden abrirse, por ejemplo, con Microsoft® Excel. Las primeras diez filas de palabras L1 únicas.csv, ordenadas de forma descendente por Sílabas y después por Longitud, son:

Los mismos datos, ordenados primero de forma descendente por Longitud y después alfabéticamente por Palabra:

Las diez palabras más frecuentes, ordenadas de forma descendente por Cantidad:

Las primeras filas de otras palabras únicas.csv, ordenadas de forma descendente por Longitud y después por Sílabas, muestran palabras que no se reconocieron como palabras inglesas válidas:

Estas palabras pueden reconocerse y contarse añadiéndolas a la lista de palabras aceptadas.
También se pueden crear gráficos como los siguientes con Microsoft® Excel a partir de palabras L1 únicas.csv:


Para realizar otro análisis, seleccione Inicio.
Consideraciones
Word Stats se desarrolló originalmente para analizar documentos de Microsoft® Word guardados como texto sin formato. Aunque admite análisis bilingües y ofrece varios idiomas y configuraciones regionales preinstalados, se ha probado principalmente con inglés (Estados Unidos) y neerlandés (Países Bajos). No se ha evaluado exhaustivamente cómo se generaliza el análisis a archivos procedentes de otras fuentes ni su funcionamiento con otros idiomas y configuraciones regionales. La aplicación se comparte con la esperanza de que resulte útil.
Word Stats está pensado para analizar documentos más o menos completos y no es un corrector ortográfico. No obstante, examinar las listas generadas, sobre todo Otras palabras y Elementos que no son palabras, puede aportar información interesante. Esto dio lugar a varios ajustes en el documento de referencia multilingüe utilizado para las pruebas.
Un efecto curioso consiste en analizar un documento en un idioma distinto del original. Por ejemplo, en el fragmento inglés de The Great Gatsby se reconocen 5.701 palabras únicas al analizarlo en inglés, 1.112 al analizarlo en francés y 1.158 al analizarlo en neerlandés.
Apéndice A. Preparación de un archivo de texto
Los archivos de texto pueden crearse de muchas formas. Word Stats se diseñó principalmente para documentos de Microsoft® Word exportados como texto sin formato. Abra el documento, seleccione Archivo --> Guardar como (o Guardar una copia) y elija Texto sin formato (.txt) en la lista superior. Al pulsar Guardar aparece el siguiente cuadro de diálogo:

Se han obtenido buenos resultados seleccionando Otra codificación y después Unicode (UTF-8), como en la siguiente imagen.1

Word convierte cada párrafo en una sola línea de texto, formato que Word Stats utiliza para contar párrafos. Los números de notas al pie se convierten, por ejemplo, de ejemplo.12 a ejemplo.12, donde el punto puede ser cualquier signo de puntuación. Word Stats puede reconocer estos números -que aparecen una vez como referencia y otra con el texto de la nota- y excluirlos del recuento. También puede reconocer e ignorar los números asociados a una tabla de contenido.
Existen muchas otras formas de crear un archivo de texto. El usuario debe comprobar que el archivo subido contiene realmente lo que desea analizar. Encontrará una breve explicación sobre archivos PDF en Ayuda/PDF a texto.
- Mediante la biblioteca Ude.NetStandard,
Word Statsdetecta y admite las siguientes codificaciones o formatos de caracteres: ASCII, UTF-8, UTF-16 Big y Little Endian, y UTF-32 Little Endian.
Apéndice B. Algoritmo de análisis
El análisis de Word Stats se realiza de la siguiente forma.
- El texto se divide en líneas mediante caracteres de salto de línea. Se admiten los formatos Windows (CR LF), Unix (LF) y macOS (CR). Cada línea se procesa como se indica a continuación.
- Se ignoran las líneas vacías.
- Se cuentan los caracteres, letras, dígitos, espacios y tabulaciones de la línea.
- Cada línea no vacía se define como un nuevo párrafo.
- Si está activado Procesar tabla de contenido, se comprueba si la línea forma parte de una tabla de contenido. Esta comienza con el texto Table of Contents y continúa mientras las líneas siguientes terminen en un número entero. El procesamiento consiste en excluir esos números de página del recuento. Actualmente esta función solo está disponible cuando el inglés es el idioma principal.
- Si está activado Procesar hipervínculos, se detectan y eliminan los hipervínculos de la línea, se cuentan y se guardan los nuevos en una lista. Se define como hipervínculo una cadena sin tabulaciones ni espacios que termina en un punto seguido de un dominio de nivel superior, opcionalmente seguido de una barra, y después de un espacio o un signo de puntuación (, . : ; ! ? ...). Se tienen en cuenta .com, .edu, .gov, .net, .org y los 247 dominios de país. Son ejemplos válidos microsoft.com y https://www.sunnysideupsoftware.com/.
- Si está activado Procesar notas al pie, se buscan y cuentan sus números, se eliminan de la línea y se añaden a una lista. Se definen como un signo de puntuación seguido de un entero y de un espacio o salto de línea, por ejemplo
.6o;7.Word Statscomprueba que no formen parte de un número legítimo, como12.6. Las referencias reconocidas no se incluyen en el recuento de números. - La línea se limpia mediante los pasos siguientes:
- eliminar caracteres de anchura cero, como guiones o espacios de anchura cero;
- sustituir los signos de fin de oración distintos del punto (? ! ...) por un punto;
- sustituir los puntos seguidos de comillas dobles por un punto para facilitar la segmentación;
- sustituir espacios especiales, como espacios finos, por un espacio normal;
- sustituir barras y tabulaciones por espacios, de modo que sí/no se procese como dos palabras;
- sustituir rayas que no sean guiones, como el guion inseparable, la raya corta y la raya larga, por un guion rodeado de espacios;
- sustituir varios espacios consecutivos por uno solo.
- La línea se divide en oraciones. Esta detección de límites es compleja, sobre todo debido a las abreviaturas con puntos. Dividir simplemente cada vez que aparece un punto seguido de un espacio contaría «El Prof. Dr. XYZ nació en el Reino Unido, pero vive en EE. UU. desde 2010» como varias oraciones.
Word Statsutiliza PragmaticSegmenterNet, una adaptación a C# de Pragmatic Segmenter, para obtener una segmentación multilingüe de alta calidad basada en reglas. PragmaticSegmenterNet no admite todos los idiomas y configuraciones regionales deWord Stats; consulte la tabla anterior. Cuando es posible se utilizan las reglas del idioma principal; en caso contrario se desactivan las estadísticas de oraciones. - Cada oración, posiblemente modificada por los pasos anteriores, se divide en tokens, cadenas de caracteres separadas por espacios. Después se procesa cada token.
- Si el token no contiene caracteres, se incrementa el recuento de Tokens vacíos.
- Si no está vacío, se limpia:
1. sustituyendo los apóstrofos tipográficos (‘ y ’) por apóstrofos rectos (');
2. eliminando los caracteres
" “ ” ¡ ! ¿ ? : ; . , … ( ) [ ] { }; 3. eliminando guiones y apóstrofos iniciales y finales. Se conservan las palabras con guion, como brother-in-law, y los apóstrofos internos, como she's. - Se comprueba si el token es un número válido. Si lo es, se incrementa Números y se guarda si es nuevo. A continuación se procesa el siguiente token.
- Si no es un número, se crea una copia en minúsculas.
- Se comprueba si esta copia es una palabra válida: una cadena de letras con cero o más guiones y un máximo de un apóstrofo. Las contracciones como didn't e it's cuentan como una sola palabra.
- Cada palabra válida se procesa así: 1. Se actualizan el Número de palabras total y las Palabras por oración. 2. Si tiene más de un carácter y su forma original o en minúsculas supera el corrector del idioma principal, o la forma en minúsculas está en la lista de palabras aceptadas y no en la de rechazadas, o si consta de un solo carácter incluido en la lista de aceptadas: 1. se cuenta como palabra del idioma principal; 2. si es nueva, se añade a la lista de Palabras únicas de dicho idioma; 3. si no contiene guiones, se cuenta como Palabra sin guion; de lo contrario, como palabra con guion del idioma principal; 4. se determina el número de sílabas con el separador silábico de NHunspell. Las partes de las palabras con guion se analizan por separado y el resultado se suma al total de sílabas; 5. se actualizan las estadísticas de Caracteres por palabra y Sílabas por palabra. 3. De lo contrario, se repite el paso 16.2 para el idioma secundario, si se ha seleccionado uno. 4. Si ningún idioma reconoce la palabra y esta tiene al menos dos caracteres, se repite el paso 16.2 para Otras palabras.
- Si el token no es un número ni una palabra válida, se incrementa Otros tokens y se guarda en la lista de tokens únicos si es nuevo.
- Al final de cada oración se actualizan Oraciones, Palabras por oración y Oraciones por párrafo. Una oración puede constar de una sola palabra.
- Al final de cada línea se actualizan las estadísticas de Párrafos. Un párrafo puede contener una sola oración.
- Una vez procesadas todas las líneas, si se seleccionó el procesamiento de notas al pie, se resta una aparición de cada número presente en la lista de notas al pie dentro de Números únicos y se eliminan las entradas que queden en cero.
- Si el inglés es el idioma principal y no se ha seleccionado un idioma secundario, se calculan las métricas de legibilidad.
- Los resultados seleccionados se guardan en archivos de valores separados por comas (.csv). El archivo de Elementos únicos que no son palabras, es decir, otros tokens, se guarda con tabulaciones (.tsv) porque los tokens pueden contener comas que interferirían con el formato CSV.