Desenvolvimento de um chatbot financeiro com recuperação aumentada por geração (RAG)

dc.contributor.advisorDalip, Daniel Hasan
dc.contributor.advisor-coSeufitelli, Danilo Boechat
dc.contributor.advisor-coLatteshttp://lattes.cnpq.br/5887701447276862
dc.contributor.advisorLatteshttp://lattes.cnpq.br/2960751321530666
dc.contributor.authorBitencourt, Pedro Vitor Melo
dc.contributor.authorLatteshttp://lattes.cnpq.br/9658153988447542
dc.contributor.refereeDalip, Daniel Hasan
dc.contributor.refereeSeufitelli, Danilo Boechat
dc.contributor.refereeBrandão, Michele Amaral
dc.contributor.refereeAmaral, Heber Fernandes
dc.date.accessioned2026-08-20T23:45:17Z
dc.date.available2026-08-20T23:45:17Z
dc.date.issued2026-06-10
dc.description.abstractO setor financeiro depende de informações precisas e verificáveis extraídas de documentos corporativos complexos. Embora os Modelos de Linguagem de Grande Porte (LLMs) apresentem capacidades avançadas de linguagem natural, sua aplicação direta em finanças ainda enfrenta desafios relacionados a alucinações, imprecisões factuais e dificuldades em lidar com informações específicas e frequentemente atualizadas. Este trabalho avalia experimentalmente diferentes estratégias de recuperação em sistemas de Recuperação Aumentada por Geração (Retrieval-Augmented Generation — RAG) aplicados à análise financeira corporativa. O pipeline experimental utiliza documentos financeiros públicos de empresas brasileiras e compara Similarity Search, Maximum Marginal Relevance (MMR), MultiQuery Retrieval e Parent Document Retrieval. Para a avaliação, foi construído um dataset especializado de perguntas e respostas financeiras, avaliado com métricas do RAGAS, incluindo Faithfulness, Context Precision, Context Recall e Answer Relevancy. Os resultados indicam que MultiQuery Retrieval apresenta melhor desempenho em tarefas que exigem maior cobertura contextual, enquanto Parent Document Retrieval é mais eficaz em cenários que demandam maior precisão contextual e fundamentação factual.
dc.description.abstractotherThe financial sector relies on accurate and verifiable information extracted from complex corporate documents. Although Large Language Models (LLMs) provide advanced natural language capabilities, their direct application in finance remains challenging due to hallucinations, factual inaccuracies, and difficulties in handling domain-specific and frequently updated information. This work experimentally evaluates different retrieval strategies in Retrieval-Augmented Generation (RAG) systems applied to corporate financial analysis. The experimental pipeline uses public financial documents from Brazilian companies and compares Similarity Search, Maximum Marginal Relevance (MMR), MultiQuery Retrieval, and Parent Document Retrieval. A domain-specific dataset of financial questions and answers was built and evaluated using RAGAS metrics, including Faithfulness, Context Precision, Context Recall, and Answer Relevancy. The results indicate that MultiQuery Retrieval performs better in tasks requiring broader contextual coverage, while Parent Document Retrieval is more effective in scenarios requiring higher contextual precision and factual grounding.
dc.identifier.urihttps://repositorio.cefetmg.br//handle/123456789/2906
dc.language.isopt
dc.publisherCentro Federal de Educação Tecnológica de Minas Gerais
dc.publisher.countryBrasil
dc.publisher.departmentDepartamento de Computação
dc.publisher.initialsCEFET-MG
dc.subjectSistemas de recuperação da informação
dc.subjectProcessamento de linguagem natural (Computação)
dc.subjectAnálise econômico-financeira
dc.titleDesenvolvimento de um chatbot financeiro com recuperação aumentada por geração (RAG)
dc.typeTrabalho de Conclusão de Curso da Graduação

Arquivos

Pacote Original
Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
Desenvolvimento de um chatbot financeiro com recuperação aumentada por geração (RAG).pdf
Tamanho:
1.79 MB
Formato:
Adobe Portable Document Format
Licença do Pacote
Agora exibindo 1 - 1 de 1
Nenhuma Miniatura disponível
Nome:
license.txt
Tamanho:
1.39 KB
Formato:
Item-specific license agreed to upon submission
Descrição: