OpenAI revela o modelo de raciocínio o3: um salto rumo à resolução avançada de problemas com IA.

Em um passo significativo para aprimorar as capacidades da IA, a OpenAI apresentou seus mais recentes modelos de raciocínio, o3 e o3-mini. Anunciados em 20 de dezembro de 2024, esses modelos representam um avanço substancial na capacidade da IA de lidar com problemas complexos e de múltiplas etapas em diversos domínios, incluindo programação, matemática e raciocínio científico.
Os modelos o3 baseiam-se nos fundamentos estabelecidos por seu antecessor, o1, lançado em setembro de 2024. A OpenAI optou estrategicamente por não usar a designação o2 para evitar possíveis conflitos de marca registrada com a empresa britânica de telecomunicações O2. Sam Altman anunciou o novo modelo no YouTube hoje cedo.
Avanços nas Capacidades de Raciocínio
O raciocínio em IA envolve a decomposição de instruções complexas em subtarefas gerenciáveis, permitindo que o sistema forneça resultados mais precisos e explicáveis. Os modelos o3 empregam uma metodologia de "cadeia de pensamento privada", permitindo que a IA delibere e planeje internamente antes de fornecer uma resposta. Essa abordagem aprimora as habilidades de resolução de problemas do modelo, tornando-o mais apto a lidar com consultas complexas.
Desempenho de referência
A OpenAI relata que o modelo o3 alcançou resultados sem precedentes em diversos benchmarks:
- Proficiência em codificaçãoO modelo o3 supera os recordes de desempenho anteriores, alcançando uma melhoria de 22.8% em relação ao seu antecessor em testes de codificação, e até mesmo supera o Cientista-Chefe da OpenAI em cenários de programação competitiva.
- Raciocínio MatemáticoNo Exame Americano de Matemática por Convite (AIME) de 2024, o modelo o3 quase alcançou a pontuação máxima, errando apenas uma questão. Além disso, resolveu 25.2% dos problemas no benchmark Frontier Math da EpochAI, um salto significativo em relação aos modelos anteriores, que não ultrapassavam 2%.
- Compreensão CientíficaO modelo alcançou uma pontuação de 87.7% no benchmark GPQA Diamond, que engloba questões de nível de pós-graduação em biologia, física e química.
O pesquisador de IA e testador de equipe vermelha François Chollet escreveu no X: “Hoje, a OpenAI anunciou o o3, seu modelo de raciocínio de próxima geração. Trabalhamos com a OpenAI para testá-lo no ARC-AGI e acreditamos que ele representa um avanço significativo na adaptação da IA a novas tarefas.”
Ele alcança 75.7% na avaliação semiprivada em modo de baixo custo computacional (por US$ 20 por tarefa) e 87.5% em modo de alto custo computacional (milhares de dólares por tarefa). É muito caro, mas não se trata apenas de força bruta — essas capacidades representam um território novo e exigem atenção científica séria.”

Fonte: X
Pesquisa de alinhamento deliberativo
Paralelamente aos modelos o3, a OpenAI introduziu uma pesquisa de alinhamento deliberativo com o objetivo de aprimorar a segurança da IA. Essa abordagem exige que a IA processe as decisões de segurança passo a passo, garantindo que as solicitações do usuário estejam alinhadas com as políticas de segurança estabelecidas. Os testes iniciais indicam que esse método melhora a adesão às diretrizes em comparação com modelos anteriores, incluindo o GPT-4.
Atualmente, os modelos o3 estão passando por testes internos de segurança. A OpenAI abriu inscrições para pesquisadores externos participarem dos testes, com o prazo de inscrição se encerrando em 10 de janeiro de 2025. O modelo o3-mini deverá ser lançado até o final de janeiro, seguido pelo modelo o3 completo.
A introdução dos modelos o3 representa um momento crucial no desenvolvimento da IA, demonstrando capacidades de raciocínio aprimoradas que aproximam a IA da resolução de problemas em nível humano. À medida que esses modelos passam por mais testes e refinamentos, eles estão prestes a estabelecer novos padrões na área, potencialmente transformando a maneira como tarefas complexas são abordadas em diversos setores.








