Última alteração: 2025-06-17
Resumo
Propuesta de un modelo para el análisis del ciclo de vida de la indización a partir del estudio del caso de las keywords en el diario El País (2000–2024)
Introducción
La visualización de información se centra en la identificación y extracción de estructuras significativas a partir de grandes volúmenes de datos, con el objetivo de representarlas visualmente para facilitar su interpretación. Este proceso implica varias etapas interrelacionadas: en primer lugar, los datos brutos se transforman en abstracciones analíticas; posteriormente, estas se convierten en un modelo visual-espacial abstracto; y finalmente, dicho modelo se materializa gráficamente mediante principios de diseño visual, permitiendo su exploración (Olmeda-Gómez, 2014). Según este mismo autor, la visualización de información adopta diversas formas según la naturaleza de los datos. La visualización geoespacial utiliza mapas para representar información localizada en el espacio, revelando patrones difíciles de detectar de otro modo. La visualización de estructuras jerárquicas y de redes permite mostrar relaciones organizadas en niveles (clasificaciones o taxonomías) o conexiones entre elementos sin jerarquía, como en las redes de interacción. Por su parte, la visualización de textos transforma el contenido de colecciones documentales en representaciones visuales, a partir de unidades como palabras, frases o metadatos.Así pues, la visualización de la información es una herramienta transversal y versátil que se adapta a prácticamente cualquier disciplina en la que existan datos susceptibles de ser interpretados, analizados o comunicados. Su valor radica en la capacidad de transformar datos abstractos y complejos en representaciones visuales, facilitando la identificación de patrones, relaciones y tendencias que podrían pasar desapercibidas mediante métodos tradicionales. Se aplica ampliamente en áreas como la ciencia de datos, la salud, la economía, el periodismo, la educación, la geografía, las humanidades digitales, o la Informetría usando el análisis de las palabras clave de autor o descriptores, entre otras unidades. Por lo general, en todos estos contextos, la visualización actúa como un puente entre ingentes volúmnes de información y la comprensión intuitiva. En un momento dominado por la sobreabundancia de datos, es una herramienta esencial para interpretar y dar sentido a la información de manera rápida, clara y significativa.Las mencionadas palabras clave procedentes de los autores de los trabajos, aunque de forma probablemente inconsciente, al igual que los descriptores temáticos producidos por profesionales, son los productos de la indización. La norma ISO 5963- 1985 define la indización como "el acto de describir o identificar un documento en términos de su contenido temático." Otra definición más precisa sería la de representar el contenido de un documento o de una necesidad de información por medio de una o varias palabras o frases. Además, el objetivo principal de la indización es propiciar un adecuado registro o almacenamiento de los documentos como su posterior recuperación y su uso (Gil-Leiva, 2008). Así pues, el proceso de la indización termina estando presente en entornos donde se gestiona información y documentos como bibliotecas, archivos, bases de datos bibliográficas o centros de documenación o archivos de medios de comunicación, entre muchos otros lugares. En definitiva, la indización tiene como objetivo representar (sustituir) extensos contenidos de información mediante unas pocas palabras, frases o descriptores. Por ejemplo, es posible representar artículos científicos de veinte o treinta páginas utilizando solo dos o tres descriptores, o expresar el contenido de una tesis doctoral de quinientas páginas con cinco o seis palabras clave. Por tanto, estas palabras clave o descriptores tienen la función y el ‘honor’ de condensar, de ser los ‘representantes’ de ingentes cantidades de contenido escrito, hablado o prendido en imágenes a lo largo del tiempo. Estas palabras clave de autor y descriptores se han usado como unidades de medida para tratar de identificar, lo que se denomina en la literatura, la ‘estructura del conocimiento’ de determinados campos o de revistas científicas incluso. Otras unidades de medida usadas para esto que se toman de la literatura publicada son los autores, las instituciones o los países de publicación. Una estructura del conocimiento es el patrón organizativo y relacional que emerge al analizar quién genera el conocimiento, sobre qué temas, y cómo se conectan esas contribuciones dentro del asunto seleccionado. Para mostrar y comprender dicha estructura del conocimiento se suele recurrir a técnicas de visualización de información.
Sin ánimo de exhaustividad, a continuación traemos algunos trabajos en este ámbito. Vargas-Quesada, Chinchilla-Rodríguez y Rodriguez (2017) presentaron un mapa global de la investigación en ‘grafeno’ utilizando los términos de más de 50.000 documentos descargados de Scopus. Su y Lee (2010) usaron las palabras clave de autor de literatura sobre ‘prospectiva tecnológica’ para componer una visualización en dos y tres dimensiones de su estructura del conocimiento. Vílchez-Román, Sanguinetti y Mauricio-Salas (2021) usaron términos con alto valor semántico y el análisis de co-palabras para ayudar en la toma de decisiones. Cantos Mateos et al. (2023) compararon las visualizaciones que ofrece el análisis de tres tipos distintos de descriptores con el fin de detectar líneas o áreas de investigación. Chávez (2023) ha desrrollado MetaMetrics, un tablero de datos interactivo para verificar la calidad de los metadatos en revistas científicas. Y por último, Gálvez (2024) usó las palabras clave de autor con análisis de co-palabras para identificar y visualizar la estructura del conocimiento de la Revista General de Información y Documentación, para tratar de identificar y valorar los tipos de familias de temas (centrales, especializados, transversales, emergentes o en desaparición) de dicha publicación.Dicho esto, consideramos que la visualización de la información y el análisis de datos a gran escala abren nuevas posibilidades para comprender la praxis de la indización, así como ofrecer herramientas de apoyo a la investigación académica de diversas áreas.La propuesta que presentamos aquí se sitúa en la intersección entre los estudios sobre vocabularios controlados y el análisis cuantitativo de su uso en contextos reales, usando para ello técnicas de visualización de la información. Partiendo de un gran corpus de noticias del diario El País (España) que cubre un periodo de 25 años, se propone un modelo para estudiar y visualizar la evolución de los términos de indización, con especial atención a su ciclo de vida, patrones de uso y relaciones semánticas. La propuesta parte de una concepción dinámica de los vocabularios, como entidades vivas que responden a fenómenos sociales, políticos y culturales. Este enfoque permite observar cómo los términos se adaptan, emergen o desaparecen en función del contexto informativo, reflejando así los cambios en la agenda pública y en los marcos de referencia sociales.Una modelización de esto ayudaría a intentar hacer visible lo invisible y podría tener varias implicaciones. Por un lado implicaciones para los propios medios de comunicación puesto podrían realizar análisis de tendencias temáticas a lo largo del tiempo y comprobar los cambios en los intereses informativos (como por ejemplo, observar cómo la palabra “cambio climático” dejó de ser un simple concepto para ser una sección propia); detección de sesgos editoriales o zonas de silencio (si ciertos temas están ausentes o sobre-representados); o estrategias de contenido y posicionamiento (identificación de nichos temáticos con baja cobertura pero alta relevancia emergente). En segundo lugar, una modelización de este tipo, podría comportar implicaciones para la investigación académica. Esta modelización podría permitir al área de Comunicación y Periodismo propiciar estudios de agenda setting (los temas importantes para los medios) y framing (desde la perspectiva que se cuenta); análisis de cobertura mediática y representación social, evolución del tratamiento de ciertos temas, estudio de transformación del lenguaje, etc. En Sociología, podría alentar el análisis de cambios socioculturales reflejados en los medios, o el estudio de fenómenos como movimientos sociales, identidad, globalización, etc,. Para estudios culturales y de antropología, podría animar a la observación de cómo se construyen narrativas culturales en los medios. Y por último, para el área de Biblioteconomia y Documentación y en especial en lo relativo a tareas de mantenimiento y actualización de vocaburios controlados, una modelización de este tipo podría resultar de interés para la conocer la evolución terminológica con la identifiación de nuevos conceptos emergentes, de obsoletos u observar sinonimias o variantes léxicas; así como para mejorar el control terminlógico analizando la coherencia en la aplicación de los términos o tal vez la consistencia terminológica del sistema de indización.ObjetivosEl trabajo persigue un doble propósito:1. Desarrollar un sistema para representar, analizar y visualizar el uso de palabras clave de corpus extensos.2. Formular y probar una metodología para generar métricas que describan el ciclo de vida de los términos de indización, identificando patrones de nacimiento, vitalidad, decadencia y uso cíclico.MetodologíaSe ha utilizado un método cuantitativo-computacional, basado en la extracción y análisis de los términos de indización. La metodología incluye la confección del corpus documental (datasets de la edición digital de El País), el uso de algoritmos, conteo de frecuencias, análisis de coocurrencia y técnicas de visualización de la información, tales como mapas de calor, grafos y redes temáticas.El modelo propuesto se estructura en cinco componentes:● Captura y normalización datos de entrada.● Transformación según un modelo de datos para su conversión a un dataset RDF que permita su exploración en un triplestore de un modo más flexible.● Elaboración de indicadores y métricas para caracterizar tanto las características descriptivas del conjunto de datos, como los aspectos vinculados al ciclo de vida/uso de los términos de indización.● Desarrollo de la exploración y visualización de resultados a través del análisis de diversas opciones para presentar tanto el dataset en sí, como los indicadores y métricas de un modo visual a través de un entorno web interactivo.Resultados parcialesTras aplicar un proceso de limpieza y normalización se ha obtenido un primer dataset en formato CSV. También se ha obtenido un modelo de datos basado en RDF para la representar la indización de objetos mediante los términos de indización. Dicho modelo ha hecho uso fundamentalmente de Dublin Core Terms, SKOS y Schema.org, facilitando una interoperabilidad semántica que puede ser reutilizada en contextos similares.Una vez aplicado dicho modelo se ha obtenido un dataset RDF para el que se ha definido su correspondiente base de datos en un servidor Apache Jena Fuseki. El dataset contenía más de 1,6 millones de noticias de el diario El País, con 73.498 etiquetas o términos de indización, con una cobertura temporal de 25 años (2000-2024).En un primer análisis del dataset se determinaron sus posibilidades de explotación para el diseño y obtención algunas métricas e indicadores:● Número total de noticias en las que aparece un término de indización (documentos/términos).● Cantidad de días distintos en los que un término fue usado (uso en días únicos).● Número de días entre el primer y el último uso de un término de indización (intervalo de uso).● IDF de cada término (Inverse Document Frecuency).● Intensidad de uso de un término (uso en días únicos dividido entre intervalo de uso)● Intensidad de aparición de un término considerando diferentes intervalos temporales.● Uso cíclico para identificar patrones de aparición periódica según una segmentación temporal.● Grado de obsolescencia que permite determinar la tendencia a desaparecer tras un pico inicial.● Rank3D para la ordenación de las keywords en función del número total de noticias en las que aparece, uso en días únicos e intervalo de uso.En el contexto del dataset utilizado (edición digital de El País) los datos muestran que la mayoría de términos se usan muy poco (el 59,2 % aparece en menos de 10 noticias), mientras que un 0,02 % indexa más de 100.000 noticias. Se han filtrado los extremos para centrarse en un subconjunto de unos 35.000 términos de indización. Los resultados revelan comportamientos repetitivos, términos efímeros y otros de uso sostenido. El modelo permite identificar estas tipologías en función de su uso y las distintas métricas e indicadores. Esta clasificación es útil no solo para entender la dinámica interna del vocabulario, sino también para estudiar fenómenos de interés como la emergencia temática, la estabilización conceptual o la pérdida de relevancia.Para examinar estos datos se ha desarrollado un entorno web interactivo disponible en http://gicd.inf.um.es/kw/ que permite explorar términos, coocurrencias y comparaciones. La aplicación muestra también diversas visualizaciones (distribución anual de uso en la indización, mapas de calor de coocurrencia de keywords, diagramas de variación de uso, clustering n-dimensional, etc).
Conclusiones
Este trabajo presenta un enfoque híbrido que combina la construcción conceptual de un modelo con la validación empírica a través de un caso real. La propuesta metodológica se muestra robusta y transferible a otros contextos (colecciones institucionales, científicas o educativas). Se está avanzando en el diseño de una herramienta accesible que permita importar nuevos datasets de indización y obtener automáticamente indicadores y visualizaciones, facilitando así la comprensión de la evolución terminológica en diferentes ámbitos de uso y dominios del conocimiento. Además, esta herramienta pretende fomentar el análisis comparado entre vocabularios y su evolución en el tiempo, fortaleciendo la investigación sobre la organización del conocimiento desde una perspectiva empírica y exploratoria; y que pudiera ser de utilidad para propiciar investigaciones en otras áreas de conocimiento.
Palabras claveIndización. Visualización de la información. Ciclo de vida terminológico
Referencias
Cantos Mateos, Gisela et al. (2023). Estudio comparativo sobre la visualización de redes de co-words a través de los descriptores del Science Citation Index y de Medline. Atas de I Congresso ISKO Espanha e Portugal / XI Congresso ISKO Espanha, Oporto (Portugal), 7 a 9 de novembro 201, p. 173-189.
Chávez, Manuel. (2023). MetaMetrics: prototipo de visualización de la calidad de los metadatos en revistas científicas latinoamericanas publicadas en Open Journal System. Biblioteca Universitaria. 26. https://doi.org/10.22201/dgbsdi.0187750xp.2023.1.1466.
Gálvez C. (2024). Mapas científicos de la Revista General de Información y Documentación (2005-2022). Revista General de Información y Documentación, 34(1), 127-140. https://doi.org/10.5209/rgid.88515.
Gil-Leiva, Isidoro. (2008). Manual de indización. Teoría y práctica. Gijón: Trea.
ISO. 1985. ISO 5963-1985: Documentation -- Methods for Examining Documents, Determining Their Subjects, and Selecting Indexing Terms. Geneva: ISO.
Jiménez, A. G., Mateos, D. R., & García, B. C. (2019). Estudio sobre la indización/etiquetado y los lenguajes documentales en cinco diarios españoles. Scire: Representación Y organización Del Conocimiento, 25(1), 55–64. https://doi.org/10.54886/scire.v25i1.4579.
Olmeda-Gómez, Carlos (2014). Visualización de información. El profesional de la información, mayo-junio, v. 23, n. 3, pp. 213-219. http://dx.doi.org/10.3145/epi.2014.may.01.Su, H.-N., & Lee, P.-C. (2010). Mapping knowledge structure by keyword co-occurrence: a first look at journal papers in Technology Foresight. Scientometrics, 85(1), 65–79. doi:10.1007/s11192-010-0259-8
Vargas-Quesada, B., Chinchilla-Rodríguez, Z., & Rodriguez, N. (2017). Identification and Visualization of the Intellectual Structure in Graphene Research. Frontiers in Research Metrics and Analytics. Frontiers Media SA. http://doi.org/10.3389/frma.2017.00007.Vílchez-Román, C., Sanguinetti, S. and Mauricio-Salas, M. (2021). Applied bibliometrics and information visualization for decision-making processes in higher education institutions. Library Hi Tech, 39 (1), pp. 263-283. https://doi.org/10.1108/LHT-10-2019-0209.