Navegando por Autor "Saldanha, Araceli Marcia"
Agora exibindo 1 - 1 de 1
Resultados por página
Opções de Ordenação
Item Visual Question Answering (VQA): novas abordagens utilizando redes neurais de aprendizado profundo(Centro Federal de Educação Tecnológica de Minas Gerais, 2025-02-27) Saldanha, Araceli Marcia; Silva, Alisson Marques da; http://lattes.cnpq.br/3856358583630209; http://lattes.cnpq.br/3149126714226259; Silva, Alisson Marques da; Dias, Thiago Magela Rodrigues; Yehia, Hani CamilleVQA (Visual Question Answering) é um problema cujo objetivo é projetar sistemas capazes de compreender o conteúdo de uma imagem de forma semelhante aos humanos e se comunicar efetivamente sobre essa imagem em linguagem natural. Embora o VQA tenha recebido ampla atenção nos últimos anos, ainda permanece um problema em aberto devido a diversos desafios, como vieses, limitações dos datasets e dificuldades na interpretabilidade dos resultados, o que faz com que essa área esteja em constante estudo. Diante desse contexto, o presente trabalho busca aprimorar a acurácia dos resultados por meio do desenvolvimento de dois métodos e quatorze abordagens, utilizando o dataset VizWiz. O primeiro método emprega grafos para a representação conjunta dos dados de entrada e utiliza uma rede neural para grafos, Graph Attention Networks (GAT), para a solução do problema. Já o segundo método realiza a fusão dos dados de entrada por meio de concatenação e emprega uma rede Multilayer Perceptron (MLP) para gerar as respostas. As abordagens propostas implementam os métodos desenvolvidos com diferentes configurações, variando aspectos como modelos para a representação dos dados de entrada, funções de perda, entre outros aspectos. A maioria das abordagens desenvolvidas alcançou resultados superiores aos apresentados na literatura analisada, com destaque para a abordagem 14, que obteve uma acurácia geral de 62.07, superando o melhor resultado reportado na literatura, que era 60.15. Além disso, mesmo as abordagens mais simples baseadas no método 1 demonstraram desempenho notável nas categorias unanswerable e number, atingindo acurácias de 100 e 23.58, respectivamente.