o3
Сначала длинная цепочка рассуждений, затем ответ: вычисления на выводе в обмен на точность
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
o3 is a reasoning model OpenAI released in April 2025, part of the o series. Unlike models that answer directly, it performs an internal chain of reasoning before producing its output, then derives the answer from that reasoning. The series is trained with reinforcement learning so the model learns to spend more reasoning steps when they buy a more reliable answer. o3 accepts text and image input and serves as the main version for mathematics, coding and scientific reasoning tasks.
Почему стоит запомнить
It turned test-time compute into a product: by reasoning at length before answering, o3 spends more compute at inference to buy steadier correctness, and made this the default shape of mainstream reasoning models.
Ключевые характеристики
- Type
- Reasoning model
- Context window
- 200K tokens
- Modality
- Text, image in; text out
- Released
- 2025-04
Возможности
Связанные концепции
Обучение с подкреплением на основе обратной связи от людей
Когда «хороший ответ» не выразить формулой, роль функции награды берут на себя люди
Промптинг и выравнивание
Сделать модель полезной, честной и безопасной труднее, чем просто увеличить её
Аналоги
DeepSeek-R1
2025Модель рассуждений, обученная RL на цепочках мыслей, с открытыми весами под лицензией MIT
Gemini
2023Универсальная модель с нативной мультимодальностью, рассчитанная на очень длинный контекст
Grok
2023Диалоговая модель, связанная с данными социальной платформы
Claude
2023Универсальная диалоговая модель, известная длинным контекстом и выравниванием по безопасности
MiniMax-M
2025Модель рассуждений с открытыми весами, гибридным вниманием и контекстом в миллион токенов