Última alteração: 2025-06-17
Resumo
Considera-se que uma representação socialmente justa e equitativa dos grupos marginalizados nos sistemas de organização do conhecimento é crucial para garantir que a informação seja recuperada de forma eficiente e com a linguagem própria da comunidade atendida. Nessa perspectiva, objetiva-se apresentar a análise de dados textuais da produção científica em Organização do Conhecimento sobre discussões de elaboração e manutenção de listas de cabeçalhos de assunto e tesauros, à luz da justiça social e da equidade. A fase quantitativa da pesquisa foi concebida durante a coleta, análise e síntese de dados oriundos de artigos de periódicos científicos, obtidos por meio do mapeamento sistemático da literatura (Silva; Dal’Evedove, 2023), o que viabilizou a seleção de publicações nessa especialidade. Foram empregadas técnicas estatísticas e de elaboração de grafos e, para a codificação, utilizou-se o Iramuteq, software destinado ao tratamento de dados. A fase qualitativa da pesquisa, por sua vez, foi viabilizada a partir dos resultados oriundos do tratamento de dados com o Iramuteq, mediante a obtenção de classes que permitiram identificar e agrupar as concepções de listas de cabeçalhos de assunto e tesauros à luz da justiça social e da equidade. Trata-se de um software livre que possibilita a análise estatística textual por meio de diversas funções, utilizando as linguagens de programação R e Python. Conforme Camargo e Justo (2013), o Iramuteq pode realizar variadas análises de dados de texto, desde dicionários de texto simples, como lematização e cálculos de frequência de palavras, até análises heterogêneas e complexas. Com o software, a distribuição de palavras pode ser organizada em uma representação gráfica compreensível e clara, com base na análise lexicográfica. Convém destacar a relevância do Iramuteq no meio científico, uma vez que já nasceu nesse contexto e absorve muitas das necessidades de análise dos cientistas provenientes das Ciências Humanas e Sociais. Para o tratamento dos dados, tal como o software requer, os metadados de título do periódico, ano de publicação e resumo, bem como a numeração de 1 a 86 estabelecida para a identificação dos documentos analisados, foram devidamente limpos, padronizados e formatados em arquivo texto (.txt) e submetidos ao Iramuteq em março de 2025. O programa utiliza os conceitos de corpus textual, texto e segmento de texto (ST). Para ele, corpus é um conjunto de textos construídos pelo usuário para formar o objeto de análise dentro do tema; o texto é a unidade da coleção, tal como um artigo compilado dentro do corpus; e o segmento de texto, via de regra, é um trecho de três linhas, dimensionado pelo próprio software de acordo com o tamanho do corpus, considerando a ambientação das palavras (Salviat, 2017). Assim, o recurso tecnológico realizou a análise de similitude, resultando na geração de grafos que representam a conexão entre as palavras no corpus do texto, de modo que o tema e a estrutura foram agrupados por relevância a partir da coocorrência entre as expressões, como um indicador de frequência. O corpus de 86 artigos (número de resumos analisados) submetidos possui 477 segmentos de texto (STs), gerados a partir do texto, contendo aproximadamente três linhas; um total de 16.917 ocorrências, ou seja, o total de palavras do corpus; 3.080 formas, sem considerar as palavras repetidas; e 1.567 hapax (termos com apenas uma ocorrência no texto), que representam 50,88% das formas e 9,26% do número de ocorrências. A análise de similitude revelou as conexões existentes entre as palavras com frequência superior a 40 nos segmentos de texto (EFF), o que evidencia a relação entre os diferentes termos e o fluxo de significados contextuais entre as maiores incidências no processo de discussão. Essa análise permitiu a sobreposição de campos de acordo com a frequência de ocorrência das palavras e a força de suas ocorrências comuns, representando nitidamente a relação entre o eixo da discussão e os vocábulos centrais. De modo complementar, foram recolhidos resultados advindos da Classificação Hierárquica Descendente (CHD), ou Classificação pelo Método de Reinert. De acordo com a predominância do assunto, a classificação forma um esquema hierárquico chamado de classes. Por meio da CHD, o Iramuteq sistematiza o corpus em classes, estabelecendo a quantidade e o conteúdo de cada uma, permitindo a compreensão dos grupos e das ideias centrais do corpus. Os resultados obtidos têm o potencial de oferecer uma compreensão mais ampla das discussões em andamento sobre a justiça social e a equidade em listas de cabeçalhos de assunto e tesauros. Isso pode contribuir para que pesquisadores e profissionais da informação trabalhem juntos no desenvolvimento de sistemas e práticas mais inclusivas e equitativas, que reflitam as necessidades de suas comunidades. A vertente aqui investigada é atual, urgente e conta com um expressivo potencial de desenvolvimento no campo da informação. Portanto, espera-se que esta pesquisa incentive e ofereça subsídios para o avanço das discussões envolvendo justiça social e equidade na Organização do Conhecimento, além de servir como recorte comparativo de uma fotografia temporal para o futuro.