Engenharia de Computação (Belo Horizonte - Nova Gameleira)
URI Permanente para esta coleção
Navegar
Navegando Engenharia de Computação (Belo Horizonte - Nova Gameleira) por Autor "Álvares, Andrei Rimsa"
Agora exibindo 1 - 2 de 2
Resultados por página
Opções de Ordenação
Item Avaliação de robustez de LLMs contra ataques semânticos de inconsistência: um estudo de caso sobre segurança em saúde mental no contexto brasileiro(Centro Federal de Educação Tecnológica de Minas Gerais, 2026-06-15) Talim, Gabriel Torres; Ferreira, Mateus Felipe Tymburibá; http://lattes.cnpq.br/5863316017246857; http://lattes.cnpq.br/7972003093242408; Ferreira, Mateus Felipe Tymburibá; Álvares, Andrei Rimsa; Dalip, Daniel HasanA integração de LLMs no setor de saúde mental apresenta riscos devido à vulnerabilidade de guardrails a variações linguísticas informais do português brasileiro. Este trabalho avalia a robustez do Llama 3.1 (8B) e do Llama 2 (8B) via framework FuzzyAI, aplicando ataques semânticos baseados em gírias, apelo emocional e interpretação de papéis. A análise revela que nuances regionais são vetores de ofuscação eficazes: o Llama 3.1 atingiu 74% de Taxa de Inconsistência do Guardrail (GIR), paradoxalmente superior à observada em seu antecessor (70%). Os resultados comprovam que filtros globais falham de forma silenciosa ao ignorar o contexto cultural brasileiro, permitindo a geração de respostas nocivas que burlam as camadas de segurança originais.Item Injeção indireta de prompt em ambientes de desenvolvimento: uma análise de segurança do protocolo MCP(Centro Federal de Educação Tecnológica de Minas Gerais, 2026-06-10) Oliveira, Pedro Veloso Inácio de; Ferreira, Mateus Felipe Tymburibá; http://lattes.cnpq.br/5863316017246857; http://lattes.cnpq.br/0511683633024448; Ferreira, Mateus Felipe Tymburibá; Álvares, Andrei Rimsa; Oliveira, Guilherme Lopes deA adoção de agentes de codificação baseados em grandes modelos de linguagem tem automatizado fluxos complexos de engenharia de software, como a revisão de pull requests. Essa automação, porém, amplia a superfície de ataque quando o agente interpreta artefatos externos como instruções operacionais. Este trabalho investiga empiricamente ataques de injeção indireta de prompt contra agentes de codificação com acesso a ferramentas locais em um fluxo de revisão de código. A avaliação utilizou servidores simulados, três modelos acessados pelo OpenCode, quatro condições experimentais e 180 execuções analisadas (15 por par modelocenário). Nos 135 cenários adversariais, a taxa de sucesso de ataque (TSA) estrita foi de 44,4% (IC 95%: 36,3–52,9). Ataques dissimulados como tarefas de suporte ou verificação de segurança alcançaram TSA estrita de 75,6% (IC 95%: 61,3–85,8) e 57,8% (IC 95%: 43,3–71,0), enquanto o ataque explícito foi recusado em quase todas as execuções e não produziu execução direta nem mescla. Os resultados indicam que artefatos rotineiros de desenvolvimento podem comprometer agentes autônomos e reforçam a necessidade de validação contextual, permissões granulares e isolamento de execução em pipelines de integração contínua.