Banca de DEFESA: CAIO GALVÃO ARAGÃO

Uma banca de DEFESA de MESTRADO foi cadastrada pelo programa.
DISCENTE : CAIO GALVÃO ARAGÃO
DATA : 05/08/2026
HORA: 14:00
LOCAL: Google Meet - https://meet.google.com/vtn-nbmb-ghh
TÍTULO:

Desidentificação de Prontuários Clínicos em Português Brasileiro Usando um Pipeline Híbrido com Modelos de Linguagem Locais


PALAVRAS-CHAVES:

Desidentificação; Registros eletrônicos de saúde; Modelos de linguagem de grande porte; Processamento de linguagem natural; Privacidade de dados; LGPD.


PÁGINAS: 50
RESUMO:

A porção não estruturada do prontuário eletrônico — as narrativas clínicas em texto livre — concentra descrições ausentes dos campos estruturados e é insumo valioso para pesquisa, gestão e melhoria do cuidado, potencial ampliado pelos avanços dos modelos de linguagem de grande porte (LLMs). Esse uso secundário, porém, exige proteger as informações pessoais identificáveis (PII) ali presentes, obrigação imposta pela Lei Geral de Proteção de Dados (LGPD); como o envio de registros identificáveis à nuvem conflita com a soberania dos dados, a anonimização deve ocorrer dentro da instituição. Esta dissertação propõe e avalia um pipeline híbrido para a desidentificação automática de registros clínicos em português brasileiro, operando inteiramente em ambiente local e offline. A arquitetura integra três camadas complementares: uma determinística (expressões regulares) para identificadores canônicos, uma estatística que remove trechos padronizados recorrentes (n-gramas) e uma neural que extrai entidades sensíveis com LLMs de propósito geral guiados por engenharia de prompts. Nos modelos locais menores, a inferência é suscetível a loops de raciocínio, repetições cíclicas que desperdiçam computação e abortam a geração; uma cascata progressiva de quatro detectores os interrompe durante a geração, com recuperação por truncamento e reinjeção do raciocínio, viabilizando esses modelos. Comitês por união e interseção, podados com Branch-and-Bound sob o critério do F₂-score, foram investigados para fundir as predições. Avaliado no corpus de referência AnonyMed-BR, o mecanismo de contenção interrompeu 99% dos loops antes do estouro da janela de contexto. Sob o conjunto-alvo de categorias de PII, o melhor modelo individual dentre os 28 avaliados (gemma4:26b) alcançou F₂ = 0,9595, não superado por nenhum comitê. No conjunto estendido, que replica a anotação do corpus para a comparação com a literatura, o pipeline completo com esse mesmo modelo atingiu F₂ = 0,9341 e revocação de 0,9537, equivalente à do modelo de referência ajustado (BERTimbau-leNER), porém obtida com um modelo de propósito geral executado localmente. Os resultados mostram que a anonimização clínica confiável é viável em hardware modesto, compatível com unidades básicas de saúde, sem transmitir dados sensíveis a serviços externos.


MEMBROS DA BANCA:
Presidente - 1766576 - THALES MIRANDA DE ALMEIDA VIEIRA
Interno(a) - 4730791 - LUCAS BENEVIDES VIANA DE AMORIM
Interno(a) - 1544992 - MARCELO COSTA OLIVEIRA
Externo(a) à Instituição - PAULO MAZZONCINI DE AZEVEDO MARQUES - USP
Notícia cadastrada em: 05/08/2026 15:03
SIGAA | NTI - Núcleo de Tecnologia da Informação - (82) 3214-1015 | Copyright © 2006-2026 - UFAL - sig-app-1.srv1inst1 24/08/2026 20:56