Avaliação de robustez de LLMs contra ataques semânticos de inconsistência: um estudo de caso sobre segurança em saúde mental no contexto brasileiro

Carregando...
Imagem de Miniatura

Data

2026-06-15

Título da Revista

ISSN da Revista

Título de Volume

Editor

Centro Federal de Educação Tecnológica de Minas Gerais

Resumo

A integração de LLMs no setor de saúde mental apresenta riscos devido à vulnerabilidade de guardrails a variações linguísticas informais do português brasileiro. Este trabalho avalia a robustez do Llama 3.1 (8B) e do Llama 2 (8B) via framework FuzzyAI, aplicando ataques semânticos baseados em gírias, apelo emocional e interpretação de papéis. A análise revela que nuances regionais são vetores de ofuscação eficazes: o Llama 3.1 atingiu 74% de Taxa de Inconsistência do Guardrail (GIR), paradoxalmente superior à observada em seu antecessor (70%). Os resultados comprovam que filtros globais falham de forma silenciosa ao ignorar o contexto cultural brasileiro, permitindo a geração de respostas nocivas que burlam as camadas de segurança originais.

Descrição

Palavras-chave

Citação