Avaliação da capacidade de detecção de emoções em modelos de linguagem multimodais (VLMs)

Carregando...
Imagem de Miniatura

Data

2026-06-18

Título da Revista

ISSN da Revista

Título de Volume

Editor

Centro Federal de Educação Tecnológica de Minas Gerais

Resumo

A capacidade de sistemas de Inteligência Artificial de compreender emoções é crucial para uma interação humano-computador empática e eficaz. Embora os Modelos de Linguagem Multimodais (VLMs) tenham demonstrado sucesso notável em tarefas objetivas, seu desempenho em tarefas subjetivas, como o reconhecimento de emoções, permanece pouco explorado. Esta pesquisa tem como objetivo avaliar e comparar o desempenho de VLMs de estado da arte no reconhecimento de emoções evocadas a partir de estímulos visuais. Adotando uma abordagem metodológica mista, utilizamos o benchmark EmoSet para avaliar quantitativamente as famílias de modelos Gemma 3 e Qwen3-VL sob execução local. Qualitativamente, analisamos os tipos de erros (e.g., viés de sentimento, excitabilidade incorreta) e o impacto de atributos visuais para compreender as limitações de raciocínio dos modelos. As contribuições esperadas incluem uma avaliação detalhada da inteligência emocional dos VLMs, o contraste em arquiteturas zero-shot, e insights para o comportamento de IAs generativas em processos de ajuste fino (fine-tuning) realizados em um modelo específico.

Descrição

Palavras-chave

Citação