Logo do repositório
  • English
  • Català
  • Čeština
  • Deutsch
  • Español
  • Français
  • Gàidhlig
  • Italiano
  • Latviešu
  • Magyar
  • Nederlands
  • Polski
  • Português
  • Português do Brasil
  • Srpski (lat)
  • Suomi
  • Svenska
  • Türkçe
  • Tiếng Việt
  • Қазақ
  • বাংলা
  • हिंदी
  • Ελληνικά
  • Српски
  • Yкраї́нська
  • Entrar
    Novo usuário? Clique aqui para cadastrar. Esqueceu sua senha?
Logo do repositório
  • Comunidades e Coleções
  • Tudo no Repositório
  • Sobre o RI-CEFETMG
  • English
  • Català
  • Čeština
  • Deutsch
  • Español
  • Français
  • Gàidhlig
  • Italiano
  • Latviešu
  • Magyar
  • Nederlands
  • Polski
  • Português
  • Português do Brasil
  • Srpski (lat)
  • Suomi
  • Svenska
  • Türkçe
  • Tiếng Việt
  • Қазақ
  • বাংলা
  • हिंदी
  • Ελληνικά
  • Српски
  • Yкраї́нська
  • Entrar
    Novo usuário? Clique aqui para cadastrar. Esqueceu sua senha?
  1. Início
  2. Pesquisar por Autor

Navegando por Autor "Saldanha, Araceli Marcia"

Agora exibindo 1 - 1 de 1
Resultados por página
Opções de Ordenação
  • Carregando...
    Imagem de Miniatura
    Item
    Visual Question Answering (VQA): novas abordagens utilizando redes neurais de aprendizado profundo
    (Centro Federal de Educação Tecnológica de Minas Gerais, 2025-02-27) Saldanha, Araceli Marcia; Silva, Alisson Marques da; http://lattes.cnpq.br/3856358583630209; http://lattes.cnpq.br/3149126714226259; Silva, Alisson Marques da; Dias, Thiago Magela Rodrigues; Yehia, Hani Camille
    VQA (Visual Question Answering) é um problema cujo objetivo é projetar sistemas capazes de compreender o conteúdo de uma imagem de forma semelhante aos humanos e se comunicar efetivamente sobre essa imagem em linguagem natural. Embora o VQA tenha recebido ampla atenção nos últimos anos, ainda permanece um problema em aberto devido a diversos desafios, como vieses, limitações dos datasets e dificuldades na interpretabilidade dos resultados, o que faz com que essa área esteja em constante estudo. Diante desse contexto, o presente trabalho busca aprimorar a acurácia dos resultados por meio do desenvolvimento de dois métodos e quatorze abordagens, utilizando o dataset VizWiz. O primeiro método emprega grafos para a representação conjunta dos dados de entrada e utiliza uma rede neural para grafos, Graph Attention Networks (GAT), para a solução do problema. Já o segundo método realiza a fusão dos dados de entrada por meio de concatenação e emprega uma rede Multilayer Perceptron (MLP) para gerar as respostas. As abordagens propostas implementam os métodos desenvolvidos com diferentes configurações, variando aspectos como modelos para a representação dos dados de entrada, funções de perda, entre outros aspectos. A maioria das abordagens desenvolvidas alcançou resultados superiores aos apresentados na literatura analisada, com destaque para a abordagem 14, que obteve uma acurácia geral de 62.07, superando o melhor resultado reportado na literatura, que era 60.15. Além disso, mesmo as abordagens mais simples baseadas no método 1 demonstraram desempenho notável nas categorias unanswerable e number, atingindo acurácias de 100 e 23.58, respectivamente.

Repositório Institucional do Centro Federal de Educação Tecnológica de Minas Gerais

repositorio@cefetmg.br

DSpace software copyright © 2002-2026 LYRASIS

  • Configurações de Cookies
  • Política de Privacidade
  • Termos de Uso
  • Enviar uma Sugestão