Desempenho de grandes modelos de linguagem (GPT-5 e Gemini 2.5 Pro) na resolução de questões do exame da OAB

dc.contributor.advisorAmorim, Lucas Pantuza
dc.contributor.authorSoares, Marcio Gabriel Gonçalves
dc.contributor.refereeSilva, Bruno Rodrigues
dc.contributor.refereeBalbino, Marcelo de Sousa
dc.date.accessioned2026-08-25T16:35:44Z
dc.date.available2026-08-25T16:35:44Z
dc.date.issued2026-07-19
dc.description.abstractGrandes Modelos de Linguagem (LLMs) têm demonstrado avanços significativos em tarefas que exigem compreensão textual e raciocínio. No entanto, a literatura brasileira carece de estudos que avaliem modelos de fronteira em contextos jurídicos nacionais. Este trabalho investigou o desempenho comparativo do GPT-5 e do Gemini 2.5 Pro na resolução das questões objetivas da 1ª fase do Exame da OAB, nos cenários zero-shot e zero-shot chain-of-thought (CoT). A pesquisa adotou um delineamento experimental controlado, com execução automatizada via APIs oficiais em ambiente de computação em nuvem, utilizando questões dos 43º e 44º Exames de Ordem. Os resultados demonstraram que mbos os modelos superam o limiar de aprovação de 50%: o GPT-5 atingiu acurácia global de 94,94% e o Gemini 2.5 Pro de 98,10% no cenário Standard. De forma contraintuitiva, o cenário Zero-shot CoT provocou redução de desempenho em ambas as arquiteturas, com quedas de 1,27 pontos percentuais para o GPT-5 e de 5,06 pontos percentuais para o Gemini 2.5 Pro. A estratificação por disciplina jurídica revelou que as maiores fragilidades relativas se concentraram em Ética Profissional, Direito Tributário e Direito Previdenciário. O estudo contribui para o entendimento das capacidades atuais dos LLMs em tarefas jurídicas em língua portuguesa e para o desenvolvimento de metodologias de avaliação reprodutíveis no contexto da Engenharia de Computação.
dc.description.abstractotherLarge Language Models (LLMs) have shown substantial progress in tasks involving textual understanding and reasoning. However, Brazilian literature lacks studies evaluating frontier models in national legal contexts. This work investigated the comparative performance of GPT-5 and Gemini 2.5 Pro on the multiple-choice questions of the Brazilian Bar Examination (OAB), under zero-shot and zero-shot chain-of-thought (CoT) prompting conditions. The study adopted a controlled experimental design, with automated execution via official APIs in a cloud computing environment, using questions collected from the 43rd and 44th Bar Exams. Results demonstrated that both models substantially surpass the 50% passing threshold: GPT-5 achieved a global accuracy of 94.94% and Gemini 2.5 Pro reached 98.10% under the Standard prompting scenario. Counter-intuitively, the Zero-shot CoT scenario produced accuracy decreases in both architectures, with reductions of 1.27 percentage points for GPT-5 and 5.06 percentage points for Gemini 2.5 Pro. Stratification by legal subject revealed that the greatest relative weaknesses were concentrated in Legal Ethics, Tax Law, and Social Security Law. The study advances the understanding of LLM capabilities in Portuguese-language legal tasks and provides a reproducible evaluation methodology relevant to the field of Computer Engineering.
dc.identifier.urihttps://repositorio.cefetmg.br//handle/123456789/2923
dc.language.isopt
dc.publisherCentro Federal de Educação Tecnológica de Minas Gerais
dc.publisher.countryBrasil
dc.publisher.departmentDepartamento de Computação e Construção Civil
dc.publisher.initialsCEFET-MG
dc.subjectInteligência artifcial
dc.subjectGPT-5
dc.subjectGemini
dc.subjectEngenharia de Computação.
dc.titleDesempenho de grandes modelos de linguagem (GPT-5 e Gemini 2.5 Pro) na resolução de questões do exame da OAB
dc.title.alternativeum estudo comparativo
dc.typeTrabalho de Conclusão de Curso da Graduação

Arquivos

Pacote Original
Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
Desempenho de grandes modelos de linguagem (GPT-5 e Gemini 2.5 Pro) na resolução de questões do exame da OAB
Tamanho:
1.33 MB
Formato:
Adobe Portable Document Format
Licença do Pacote
Agora exibindo 1 - 1 de 1
Nenhuma Miniatura disponível
Nome:
license.txt
Tamanho:
1.39 KB
Formato:
Item-specific license agreed to upon submission
Descrição: