Visual Question Answering (VQA): novas abordagens utilizando redes neurais de aprendizado profundo
| dc.contributor.advisor | Silva, Alisson Marques da | |
| dc.contributor.advisorLattes | http://lattes.cnpq.br/3856358583630209 | |
| dc.contributor.author | Saldanha, Araceli Marcia | |
| dc.contributor.authorLattes | http://lattes.cnpq.br/3149126714226259 | |
| dc.contributor.referee | Silva, Alisson Marques da | |
| dc.contributor.referee | Dias, Thiago Magela Rodrigues | |
| dc.contributor.referee | Yehia, Hani Camille | |
| dc.date.accessioned | 2026-10-05T16:00:58Z | |
| dc.date.available | 2026-10-05T16:00:58Z | |
| dc.date.issued | 2025-02-27 | |
| dc.description.abstract | VQA (Visual Question Answering) é um problema cujo objetivo é projetar sistemas capazes de compreender o conteúdo de uma imagem de forma semelhante aos humanos e se comunicar efetivamente sobre essa imagem em linguagem natural. Embora o VQA tenha recebido ampla atenção nos últimos anos, ainda permanece um problema em aberto devido a diversos desafios, como vieses, limitações dos datasets e dificuldades na interpretabilidade dos resultados, o que faz com que essa área esteja em constante estudo. Diante desse contexto, o presente trabalho busca aprimorar a acurácia dos resultados por meio do desenvolvimento de dois métodos e quatorze abordagens, utilizando o dataset VizWiz. O primeiro método emprega grafos para a representação conjunta dos dados de entrada e utiliza uma rede neural para grafos, Graph Attention Networks (GAT), para a solução do problema. Já o segundo método realiza a fusão dos dados de entrada por meio de concatenação e emprega uma rede Multilayer Perceptron (MLP) para gerar as respostas. As abordagens propostas implementam os métodos desenvolvidos com diferentes configurações, variando aspectos como modelos para a representação dos dados de entrada, funções de perda, entre outros aspectos. A maioria das abordagens desenvolvidas alcançou resultados superiores aos apresentados na literatura analisada, com destaque para a abordagem 14, que obteve uma acurácia geral de 62.07, superando o melhor resultado reportado na literatura, que era 60.15. Além disso, mesmo as abordagens mais simples baseadas no método 1 demonstraram desempenho notável nas categorias unanswerable e number, atingindo acurácias de 100 e 23.58, respectivamente. | |
| dc.description.abstractother | VQA (Visual Question Answering) is a problem whose goal is to design systems capable of understanding the content of an image in a human-like manner and effectively communicating about that image in natural language. Although VQA has received widespread attention in recent years, it remains an open problem due to several challenges, such as biases, limitations of datasets, and difficulties in interpreting results, which puts this area under constant study. Given this context, this work seeks to improve the accuracy of the results by developing two methods and fourteen approaches using the dataset VizWiz. The first method employs graphs for the joint representation of the input data and uses a graph neural network, Graph Attention Network (GAT), to solve the problem. The second method fuses the input data through concatenation and employs a Multilayer Perceptron (MLP) network to generate the answers. The proposed approaches implement the developed methods with different configurations, varying aspects such as models for representing the input data and loss functions, among other aspects. Most of the developed approaches achieved results superior to those presented in the analyzed literature, emphasizing approach 14, which obtained an overall accuracy of 62.07, surpassing the best result reported in the literature, which was 60.15. Furthermore, even the most straightforward approaches based on method 1 demonstrated remarkable performance in the unanswerable and number categories, reaching accuracies of 100 and 23.58, respectively. | |
| dc.identifier.uri | https://repositorio.cefetmg.br//handle/123456789/3108 | |
| dc.language.iso | pt | |
| dc.publisher | Centro Federal de Educação Tecnológica de Minas Gerais | |
| dc.publisher.country | Brasil | |
| dc.publisher.initials | CEFET-MG | |
| dc.publisher.program | Programa de Pós-Graduação em Modelagem Matemática e Computacional | |
| dc.subject | Recuperação de informações – Teses | |
| dc.subject | Linguística – Processamento de dados – Teses | |
| dc.subject | Conjunto de dados – Teses | |
| dc.subject | Teoria dos grafos – Processamento de dados – Teses | |
| dc.subject | Atenção – Modelos matemáticos – Teses | |
| dc.subject | Redes neurais (Computação) – Teses | |
| dc.subject | Perceptron – Teses | |
| dc.title | Visual Question Answering (VQA): novas abordagens utilizando redes neurais de aprendizado profundo | |
| dc.type | Dissertação |
Arquivos
Pacote Original
1 - 1 de 1
Carregando...
- Nome:
- Visual Question Answering (VQA) novas abordagens utilizando redes neurais de.pdf
- Tamanho:
- 15.19 MB
- Formato:
- Adobe Portable Document Format
Licença do Pacote
1 - 1 de 1
Nenhuma Miniatura disponível
- Nome:
- license.txt
- Tamanho:
- 1.39 KB
- Formato:
- Item-specific license agreed to upon submission
- Descrição: