Amorim, Lucas PantuzaSoares, Marcio Gabriel Gonçalves2026-08-252026-07-19https://repositorio.cefetmg.br//handle/123456789/2923Grandes Modelos de Linguagem (LLMs) têm demonstrado avanços significativos em tarefas que exigem compreensão textual e raciocínio. No entanto, a literatura brasileira carece de estudos que avaliem modelos de fronteira em contextos jurídicos nacionais. Este trabalho investigou o desempenho comparativo do GPT-5 e do Gemini 2.5 Pro na resolução das questões objetivas da 1ª fase do Exame da OAB, nos cenários zero-shot e zero-shot chain-of-thought (CoT). A pesquisa adotou um delineamento experimental controlado, com execução automatizada via APIs oficiais em ambiente de computação em nuvem, utilizando questões dos 43º e 44º Exames de Ordem. Os resultados demonstraram que mbos os modelos superam o limiar de aprovação de 50%: o GPT-5 atingiu acurácia global de 94,94% e o Gemini 2.5 Pro de 98,10% no cenário Standard. De forma contraintuitiva, o cenário Zero-shot CoT provocou redução de desempenho em ambas as arquiteturas, com quedas de 1,27 pontos percentuais para o GPT-5 e de 5,06 pontos percentuais para o Gemini 2.5 Pro. A estratificação por disciplina jurídica revelou que as maiores fragilidades relativas se concentraram em Ética Profissional, Direito Tributário e Direito Previdenciário. O estudo contribui para o entendimento das capacidades atuais dos LLMs em tarefas jurídicas em língua portuguesa e para o desenvolvimento de metodologias de avaliação reprodutíveis no contexto da Engenharia de Computação.ptDesempenho de grandes modelos de linguagem (GPT-5 e Gemini 2.5 Pro) na resolução de questões do exame da OABum estudo comparativoTrabalho de Conclusão de Curso da Graduação2026-08-25Inteligência artifcialGPT-5GeminiEngenharia de Computação.