跳到正文
AI 图鉴

DeepSeek-R1

用强化学习训练推理链、权重以 MIT 许可开放的推理模型

DeepSeek 模型 开放权重
输入文本文本

它是什么

DeepSeek-R1 是 DeepSeek 于 2025 年 1 月发布的推理模型,在输出答案前先生成长的思维链。它用强化学习训练模型自主产生推理步骤,而不是依赖大量人工标注的推理示例。R1 基于 V3 系列的架构规模,权重以 MIT 许可开放,并公开了训练方法的技术报告。发布后出现了大量基于 R1 的蒸馏版本,把推理能力迁移到更小的模型上。

为什么值得记住

把前沿推理模型的权重以 MIT 许可完整开放,并给出可复现的强化学习训练方案;发布后大量蒸馏版本出现,改变了不少团队“自建推理能力”的成本结构。

关键规格

参数规模
671B(MoE,激活 37B)
上下文窗口
128K tokens
开放权重
是(MIT 许可)
类型
推理模型(reasoning model)

所属能力

相关概念

同类产品