Avaliação de robustez de LLMs contra ataques semânticos de inconsistência: um estudo de caso sobre segurança em saúde mental no contexto brasileiro

dc.contributor.advisorFerreira, Mateus Felipe Tymburibá
dc.contributor.advisorLatteshttp://lattes.cnpq.br/5863316017246857
dc.contributor.authorTalim, Gabriel Torres
dc.contributor.authorLatteshttp://lattes.cnpq.br/7972003093242408
dc.contributor.refereeFerreira, Mateus Felipe Tymburibá
dc.contributor.refereeÁlvares, Andrei Rimsa
dc.contributor.refereeDalip, Daniel Hasan
dc.date.accessioned2026-08-24T16:38:06Z
dc.date.available2026-08-24T16:38:06Z
dc.date.issued2026-06-15
dc.description.abstractA integração de LLMs no setor de saúde mental apresenta riscos devido à vulnerabilidade de guardrails a variações linguísticas informais do português brasileiro. Este trabalho avalia a robustez do Llama 3.1 (8B) e do Llama 2 (8B) via framework FuzzyAI, aplicando ataques semânticos baseados em gírias, apelo emocional e interpretação de papéis. A análise revela que nuances regionais são vetores de ofuscação eficazes: o Llama 3.1 atingiu 74% de Taxa de Inconsistência do Guardrail (GIR), paradoxalmente superior à observada em seu antecessor (70%). Os resultados comprovam que filtros globais falham de forma silenciosa ao ignorar o contexto cultural brasileiro, permitindo a geração de respostas nocivas que burlam as camadas de segurança originais.
dc.description.abstractotherIntegrating LLMs into the mental health sector presents risks due to the vulnerability of guardrails to informal linguistic variations in Brazilian Portuguese. This work evaluates the robustness of Llama 3.1 (8B) and Llama 2 (8B) via the FuzzyAI framework, applying single-shot semantic attacks based on slang, emotional appeal, and roleplay. The analysis reveals that regional nuances are effective obfuscation vectors: Llama 3.1 achieved a 74% Guardrail Inconsistency Rate (GIR), paradoxically higher than that observed in its predecessor (70%). The results demonstrate that global filters fail silently by ignoring the Brazilian cultural context, allowing the generation of harmful responses that bypass the original security layers.
dc.identifier.urihttps://repositorio.cefetmg.br//handle/123456789/2920
dc.language.isopt
dc.publisherCentro Federal de Educação Tecnológica de Minas Gerais
dc.publisher.countryBrasil
dc.publisher.departmentDepartamento de Computação
dc.publisher.initialsCEFET-MG
dc.titleAvaliação de robustez de LLMs contra ataques semânticos de inconsistência: um estudo de caso sobre segurança em saúde mental no contexto brasileiro
dc.typeTrabalho de Conclusão de Curso da Graduação

Arquivos

Pacote Original
Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
Avaliação de robustez de LLMs contra ataques semânticos de inconsistência um estudo de caso sobre segurança em saúde mental no contexto brasileiro.pdf
Tamanho:
525.81 KB
Formato:
Adobe Portable Document Format
Licença do Pacote
Agora exibindo 1 - 1 de 1
Nenhuma Miniatura disponível
Nome:
license.txt
Tamanho:
1.39 KB
Formato:
Item-specific license agreed to upon submission
Descrição: