o3
Razona largamente antes de responder: cambia cómputo en inferencia por más aciertos
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
o3 is a reasoning model OpenAI released in April 2025, part of the o series. Unlike models that answer directly, it performs an internal chain of reasoning before producing its output, then derives the answer from that reasoning. The series is trained with reinforcement learning so the model learns to spend more reasoning steps when they buy a more reliable answer. o3 accepts text and image input and serves as the main version for mathematics, coding and scientific reasoning tasks.
Por qué merece la pena recordarlo
It turned test-time compute into a product: by reasoning at length before answering, o3 spends more compute at inference to buy steadier correctness, and made this the default shape of mainstream reasoning models.
Especificaciones clave
- Type
- Reasoning model
- Context window
- 200K tokens
- Modality
- Text, image in; text out
- Released
- 2025-04
Capacidades
Razonamiento y cadena de pensamiento
Descomponer un problema difícil en pasos intermedios
Conversación y seguimiento de instrucciones
Entender la intención en el diálogo y actuar en consecuencia
Generación de código
Escribir código ejecutable a partir de una descripción
Conceptos relacionados
Aprendizaje por refuerzo a partir de retroalimentación humana
Cuando la «buena respuesta» no cabe en una fórmula, deja que las personas actúen como recompensa
Ingeniería de prompts y alineación
Hacer que un modelo sea útil, honesto e inofensivo es más difícil que simplemente agrandarlo
Productos similares
DeepSeek-R1
2025Un modelo de razonamiento entrenado con RL sobre cadenas de pensamiento, con pesos abiertos bajo licencia MIT
Gemini
2023Un modelo general nativamente multimodal, pensado para contextos muy largos
Grok
2023Un modelo de chat ligado a los datos de una red social
Claude
2023Un modelo de chat general conocido por su contexto largo y su alineación de seguridad
MiniMax-M
2025Un modelo de razonamiento de pesos abiertos con atención híbrida y contexto de un millón de tokens