Avaliação da capacidade de detecção de emoções em modelos de linguagem multimodais (VLMs)
Carregando...
Data
2026-06-18
Autores
Título da Revista
ISSN da Revista
Título de Volume
Editor
Centro Federal de Educação Tecnológica de Minas Gerais
Resumo
A capacidade de sistemas de Inteligência Artificial de compreender emoções é crucial para uma interação humano-computador empática e eficaz. Embora os Modelos de Linguagem Multimodais (VLMs) tenham demonstrado sucesso notável em tarefas objetivas, seu desempenho em tarefas subjetivas, como o reconhecimento de emoções, permanece pouco explorado. Esta pesquisa tem como objetivo avaliar e comparar o desempenho de VLMs de estado da arte no reconhecimento de emoções evocadas a partir de estímulos visuais. Adotando uma abordagem metodológica mista, utilizamos o benchmark EmoSet para avaliar quantitativamente as famílias de modelos Gemma 3 e Qwen3-VL sob execução local. Qualitativamente, analisamos os tipos de erros (e.g., viés de sentimento, excitabilidade incorreta) e o impacto de atributos visuais para compreender as limitações de raciocínio dos modelos. As contribuições esperadas incluem uma avaliação detalhada da inteligência emocional dos VLMs, o contraste em arquiteturas zero-shot, e insights para o comportamento de IAs generativas em processos de ajuste fino (fine-tuning) realizados em um modelo específico.