Caracterização e identificação de idiomas em textos com base na teoria da informação
Identificação de idioma; Teoria da informação; Processamento de sinais
Este trabalho se propõe a combinar métricas de Teoria da Informação e modelos de aprendizado para identificar idiomas em textos. As métricas utilizadas são Entropia de Shannon, Complexidade Estatística e Informação de Fisher, extraídas da representação simbólica de Bandt–Pompe sobre a série temporal de códigos UTF-8. Utilizamos com baseline o método proposto por \citet{hassanpour2021} que trata textos como séries temporais de codepoints UTF-8, agrupa-os em seis clusters com base na média dos códigos, decompõe cada sinal em 32 sub-bandas e classifica os idiomas por meio de uma rede neural perceptron multicamadas (MLP). O corpus foi composto por 29 mil textos extraídos da Wikipedia, distribuídos igualmente entre 29 idiomas, com divisão de 80\% para treino e 20\% para teste, e os experimentos são conduzidos com 1, 5, 7 e 12 espaços artificiais inseridos entre palavras consecutivas. A extensão proposta pelo trabalho consistiu em calcular a distribuição de padrões ordinais para cada texto, via representação de Bandt--Pompe, extraindo as coordenadas dos idiomas nos planos Entropia--Complexidade (EC) e Shannon--Fisher (SF), e incorporando os centroides por idioma como features adicionais ao vetor de entrada da MLP. O baseline atingiu acurácia de 75,26\% na configuração de 12 espaços, com média global de 72,71\%. A inclusão dos centroides no plano EC elevou a média para 74,51\%, com ganhos mais expressivos nas configurações de 5 e 7 espaços (76,65\% e 77,39\%, respectivamente). O melhor desempenho foi obtido com o plano SF, que alcançou média global de 76,01\% e acurácia de 78,18\% com 12 espaços. A partir dos resultados pudemos verificar que as métricas de Teoria da Informação podem contribuir de forma eficaz como features auxiliares em modelos supervisionados.