输入文本文本
它是什么
DeepSeek-R1 是 DeepSeek 于 2025 年 1 月发布的推理模型,在输出答案前先生成长的思维链。它用强化学习训练模型自主产生推理步骤,而不是依赖大量人工标注的推理示例。R1 基于 V3 系列的架构规模,权重以 MIT 许可开放,并公开了训练方法的技术报告。发布后出现了大量基于 R1 的蒸馏版本,把推理能力迁移到更小的模型上。
为什么值得记住
把前沿推理模型的权重以 MIT 许可完整开放,并给出可复现的强化学习训练方案;发布后大量蒸馏版本出现,改变了不少团队“自建推理能力”的成本结构。
关键规格
- 参数规模
- 671B(MoE,激活 37B)
- 上下文窗口
- 128K tokens
- 开放权重
- 是(MIT 许可)
- 类型
- 推理模型(reasoning model)