Desempenho de grandes modelos de linguagem (GPT-5 e Gemini 2.5 Pro) na resolução de questões do exame da OAB
| dc.contributor.advisor | Amorim, Lucas Pantuza | |
| dc.contributor.author | Soares, Marcio Gabriel Gonçalves | |
| dc.contributor.referee | Silva, Bruno Rodrigues | |
| dc.contributor.referee | Balbino, Marcelo de Sousa | |
| dc.date.accessioned | 2026-08-25T16:35:44Z | |
| dc.date.available | 2026-08-25T16:35:44Z | |
| dc.date.issued | 2026-07-19 | |
| dc.description.abstract | Grandes Modelos de Linguagem (LLMs) têm demonstrado avanços significativos em tarefas que exigem compreensão textual e raciocínio. No entanto, a literatura brasileira carece de estudos que avaliem modelos de fronteira em contextos jurídicos nacionais. Este trabalho investigou o desempenho comparativo do GPT-5 e do Gemini 2.5 Pro na resolução das questões objetivas da 1ª fase do Exame da OAB, nos cenários zero-shot e zero-shot chain-of-thought (CoT). A pesquisa adotou um delineamento experimental controlado, com execução automatizada via APIs oficiais em ambiente de computação em nuvem, utilizando questões dos 43º e 44º Exames de Ordem. Os resultados demonstraram que mbos os modelos superam o limiar de aprovação de 50%: o GPT-5 atingiu acurácia global de 94,94% e o Gemini 2.5 Pro de 98,10% no cenário Standard. De forma contraintuitiva, o cenário Zero-shot CoT provocou redução de desempenho em ambas as arquiteturas, com quedas de 1,27 pontos percentuais para o GPT-5 e de 5,06 pontos percentuais para o Gemini 2.5 Pro. A estratificação por disciplina jurídica revelou que as maiores fragilidades relativas se concentraram em Ética Profissional, Direito Tributário e Direito Previdenciário. O estudo contribui para o entendimento das capacidades atuais dos LLMs em tarefas jurídicas em língua portuguesa e para o desenvolvimento de metodologias de avaliação reprodutíveis no contexto da Engenharia de Computação. | |
| dc.description.abstractother | Large Language Models (LLMs) have shown substantial progress in tasks involving textual understanding and reasoning. However, Brazilian literature lacks studies evaluating frontier models in national legal contexts. This work investigated the comparative performance of GPT-5 and Gemini 2.5 Pro on the multiple-choice questions of the Brazilian Bar Examination (OAB), under zero-shot and zero-shot chain-of-thought (CoT) prompting conditions. The study adopted a controlled experimental design, with automated execution via official APIs in a cloud computing environment, using questions collected from the 43rd and 44th Bar Exams. Results demonstrated that both models substantially surpass the 50% passing threshold: GPT-5 achieved a global accuracy of 94.94% and Gemini 2.5 Pro reached 98.10% under the Standard prompting scenario. Counter-intuitively, the Zero-shot CoT scenario produced accuracy decreases in both architectures, with reductions of 1.27 percentage points for GPT-5 and 5.06 percentage points for Gemini 2.5 Pro. Stratification by legal subject revealed that the greatest relative weaknesses were concentrated in Legal Ethics, Tax Law, and Social Security Law. The study advances the understanding of LLM capabilities in Portuguese-language legal tasks and provides a reproducible evaluation methodology relevant to the field of Computer Engineering. | |
| dc.identifier.uri | https://repositorio.cefetmg.br//handle/123456789/2923 | |
| dc.language.iso | pt | |
| dc.publisher | Centro Federal de Educação Tecnológica de Minas Gerais | |
| dc.publisher.country | Brasil | |
| dc.publisher.department | Departamento de Computação e Construção Civil | |
| dc.publisher.initials | CEFET-MG | |
| dc.subject | Inteligência artifcial | |
| dc.subject | GPT-5 | |
| dc.subject | Gemini | |
| dc.subject | Engenharia de Computação. | |
| dc.title | Desempenho de grandes modelos de linguagem (GPT-5 e Gemini 2.5 Pro) na resolução de questões do exame da OAB | |
| dc.title.alternative | um estudo comparativo | |
| dc.type | Trabalho de Conclusão de Curso da Graduação |
Arquivos
Pacote Original
1 - 1 de 1
Carregando...
- Nome:
- Desempenho de grandes modelos de linguagem (GPT-5 e Gemini 2.5 Pro) na resolução de questões do exame da OAB
- Tamanho:
- 1.33 MB
- Formato:
- Adobe Portable Document Format
Licença do Pacote
1 - 1 de 1
Nenhuma Miniatura disponível
- Nome:
- license.txt
- Tamanho:
- 1.39 KB
- Formato:
- Item-specific license agreed to upon submission
- Descrição: