DeepSeek-R1
Модель рассуждений, обученная RL на цепочках мыслей, с открытыми весами под лицензией MIT
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
DeepSeek-R1 is a reasoning model DeepSeek released in January 2025 that produces a long chain of thought before answering. It trains the model with reinforcement learning to generate reasoning steps on its own, rather than relying on large sets of human-labelled rationales. R1 shares the architecture scale of the V3 family, releases its weights under the MIT licence and publishes a technical report on its training method. After release, many distilled versions of R1 appeared, transferring its reasoning ability into smaller models.
Почему стоит запомнить
It fully open-sourced the weights of a frontier reasoning model under the MIT licence and published a reproducible RL training recipe; the wave of distilled versions that followed changed the cost structure of building one’s own reasoning capability.
Ключевые характеристики
- Parameters
- 671B (MoE, 37B active)
- Context window
- 128K tokens
- Open weights
- Yes (MIT licence)
- Type
- Reasoning model
Возможности
Рассуждение и цепочка мыслей
Разбить трудную задачу на промежуточные шаги
Генерация текста
Продолжает текст слово за словом
Диалог и следование инструкциям
Понимать намерение по ходу диалога и выполнять его
Генерация кода
Писать исполняемый код по текстовому описанию
Связанные концепции
Обучение с подкреплением на основе обратной связи от людей
Когда «хороший ответ» не выразить формулой, роль функции награды берут на себя люди
Промптинг и выравнивание
Сделать модель полезной, честной и безопасной труднее, чем просто увеличить её
Архитектура Transformer
Замена эстафеты по одному слову залом, где все говорят сразу, — и дальние зависимости оказываются в одном шаге
Аналоги
o3
2025Сначала длинная цепочка рассуждений, затем ответ: вычисления на выводе в обмен на точность
DeepSeek-V3
2024MoE с открытыми весами на 671B параметров, активирующий 37B на токен
Qwen
2023Семейство с открытыми весами, охватывающее разные размеры и мультимодальные версии
MiniMax-M
2025Модель рассуждений с открытыми весами, гибридным вниманием и контекстом в миллион токенов