Рассуждение и цепочка мыслей
Разбить трудную задачу на промежуточные шаги
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО ЗА ВОЗМОЖНОСТЬ
Takes a problem requiring several steps — a maths problem, a logic puzzle, a task needing a plan — and returns the answer together with intermediate steps. Unlike free generation the goal is correctness rather than fluency, and unlike ordinary conversation it spends much of its compute on an internal scratchpad, showing the user mainly the result and a short rationale.
Как это устроено
One family relies on prompting: examples or instructions ask the model to think before answering, writing steps out explicitly — chain-of-thought. Another relies on training: large-scale reinforcement learning on verifiable problems such as maths and code teaches the model to generate a longer deliberation before committing. Self-consistency voting over several sampled chains, and combining deliberation with tool calls or search, are now common too.
Примеры продуктов
23o3
2025Сначала длинная цепочка рассуждений, затем ответ: вычисления на выводе в обмен на точность
DeepSeek-R1
2025Модель рассуждений, обученная RL на цепочках мыслей, с открытыми весами под лицензией MIT
Gemini
2023Универсальная модель с нативной мультимодальностью, рассчитанная на очень длинный контекст
Claude
2023Универсальная диалоговая модель, известная длинным контекстом и выравниванием по безопасности
Qwen
2023Семейство с открытыми весами, охватывающее разные размеры и мультимодальные версии
MiniMax-M
2025Модель рассуждений с открытыми весами, гибридным вниманием и контекстом в миллион токенов
DeepSeek-V3
2024MoE с открытыми весами на 671B параметров, активирующий 37B на токен
GPT-4o
2024Универсальная модель с нативной мультимодальностью: текст, изображение и звук через один вход
Jamba
2024Модель с открытыми весами, сочетающая модель пространства состояний и Transformer
DBRX
2024Языковая MoE-модель с открытыми весами от Databricks
Mistral Large
2024Флагманская коммерческая модель европейской лаборатории открытых весов
Gemini
2024Единое окно диалога, собравшее поиск, офисные приложения и мультимодальную модель
Grok
2023Диалоговая модель, связанная с данными социальной платформы
Yi
2023Двуязычная (китайско-английская) модель с открытыми весами и очень длинным контекстом
Hunyuan
2023Семейство универсальных моделей Tencent с открытыми весами
Doubao
2023Универсальная диалоговая модель и приложение ByteDance
Phi
2023Небольшие эффективные модели, построенные на отобранных данных
Step
2023Семейство универсальных моделей для мультимодальности и работы на устройстве
Baichuan
2023Универсальная модель с открытыми весами для китайского языка
GLM
2023Китайская универсальная модель, начавшая с авторегрессивного заполнения пропусков
Llama
2023Семейство моделей, сделавшее открытые веса массовым путём
ChatGPT
2022Окно диалога, которое сделало большую языковую модель доступной каждому
Pangu
2020Семейство базовых моделей Pangu от Huawei
Связанные организации
Типичное применение
- Solving maths and physics problems
- Multi-step planning and scheduling
- Code and data problems needing derivation
- Reasoned choices under constraints
Как её оценивают
- Math benchmark accuracy
- Correct-answer rate on sets such as GSM8K, MATH, AIME
- pass@k
- Share of problems solved by at least one of k samples
- Chain-of-thought faithfulness
- Whether the written steps actually reflect how the answer was reached
Границы и трудности
- The written reasoning can be unfaithful: the answer comes first and a plausible rationale is added after
- In long chains an early misstep propagates, yet the final answer still sounds assured
- Deliberating at length on trivial questions inflates latency and cost
Концепции в основе
Промптинг и выравнивание
Сделать модель полезной, честной и безопасной труднее, чем просто увеличить её
Обучение с подкреплением на основе обратной связи от людей
Когда «хороший ответ» не выразить формулой, роль функции награды берут на себя люди
Архитектура Transformer
Замена эстафеты по одному слову залом, где все говорят сразу, — и дальние зависимости оказываются в одном шаге