Avaliação de robustez de LLMs contra ataques semânticos de inconsistência: um estudo de caso sobre segurança em saúde mental no contexto brasileiro
| dc.contributor.advisor | Ferreira, Mateus Felipe Tymburibá | |
| dc.contributor.advisorLattes | http://lattes.cnpq.br/5863316017246857 | |
| dc.contributor.author | Talim, Gabriel Torres | |
| dc.contributor.authorLattes | http://lattes.cnpq.br/7972003093242408 | |
| dc.contributor.referee | Ferreira, Mateus Felipe Tymburibá | |
| dc.contributor.referee | Álvares, Andrei Rimsa | |
| dc.contributor.referee | Dalip, Daniel Hasan | |
| dc.date.accessioned | 2026-08-24T16:38:06Z | |
| dc.date.available | 2026-08-24T16:38:06Z | |
| dc.date.issued | 2026-06-15 | |
| dc.description.abstract | A integração de LLMs no setor de saúde mental apresenta riscos devido à vulnerabilidade de guardrails a variações linguísticas informais do português brasileiro. Este trabalho avalia a robustez do Llama 3.1 (8B) e do Llama 2 (8B) via framework FuzzyAI, aplicando ataques semânticos baseados em gírias, apelo emocional e interpretação de papéis. A análise revela que nuances regionais são vetores de ofuscação eficazes: o Llama 3.1 atingiu 74% de Taxa de Inconsistência do Guardrail (GIR), paradoxalmente superior à observada em seu antecessor (70%). Os resultados comprovam que filtros globais falham de forma silenciosa ao ignorar o contexto cultural brasileiro, permitindo a geração de respostas nocivas que burlam as camadas de segurança originais. | |
| dc.description.abstractother | Integrating LLMs into the mental health sector presents risks due to the vulnerability of guardrails to informal linguistic variations in Brazilian Portuguese. This work evaluates the robustness of Llama 3.1 (8B) and Llama 2 (8B) via the FuzzyAI framework, applying single-shot semantic attacks based on slang, emotional appeal, and roleplay. The analysis reveals that regional nuances are effective obfuscation vectors: Llama 3.1 achieved a 74% Guardrail Inconsistency Rate (GIR), paradoxically higher than that observed in its predecessor (70%). The results demonstrate that global filters fail silently by ignoring the Brazilian cultural context, allowing the generation of harmful responses that bypass the original security layers. | |
| dc.identifier.uri | https://repositorio.cefetmg.br//handle/123456789/2920 | |
| dc.language.iso | pt | |
| dc.publisher | Centro Federal de Educação Tecnológica de Minas Gerais | |
| dc.publisher.country | Brasil | |
| dc.publisher.department | Departamento de Computação | |
| dc.publisher.initials | CEFET-MG | |
| dc.title | Avaliação de robustez de LLMs contra ataques semânticos de inconsistência: um estudo de caso sobre segurança em saúde mental no contexto brasileiro | |
| dc.type | Trabalho de Conclusão de Curso da Graduação |
Arquivos
Pacote Original
1 - 1 de 1
Carregando...
- Nome:
- Avaliação de robustez de LLMs contra ataques semânticos de inconsistência um estudo de caso sobre segurança em saúde mental no contexto brasileiro.pdf
- Tamanho:
- 525.81 KB
- Formato:
- Adobe Portable Document Format
Licença do Pacote
1 - 1 de 1
Nenhuma Miniatura disponível
- Nome:
- license.txt
- Tamanho:
- 1.39 KB
- Formato:
- Item-specific license agreed to upon submission
- Descrição: