Ferreira, Mateus Felipe TymburibáTalim, Gabriel Torres2026-08-242026-06-15https://repositorio.cefetmg.br//handle/123456789/2920A integração de LLMs no setor de saúde mental apresenta riscos devido à vulnerabilidade de guardrails a variações linguísticas informais do português brasileiro. Este trabalho avalia a robustez do Llama 3.1 (8B) e do Llama 2 (8B) via framework FuzzyAI, aplicando ataques semânticos baseados em gírias, apelo emocional e interpretação de papéis. A análise revela que nuances regionais são vetores de ofuscação eficazes: o Llama 3.1 atingiu 74% de Taxa de Inconsistência do Guardrail (GIR), paradoxalmente superior à observada em seu antecessor (70%). Os resultados comprovam que filtros globais falham de forma silenciosa ao ignorar o contexto cultural brasileiro, permitindo a geração de respostas nocivas que burlam as camadas de segurança originais.ptAvaliação de robustez de LLMs contra ataques semânticos de inconsistência: um estudo de caso sobre segurança em saúde mental no contexto brasileiroTrabalho de Conclusão de Curso da Graduação2026-08-24