输入文本文本
它是什么
DeepSeek-V3 是 DeepSeek 于 2024 年 12 月发布的开放权重模型,采用混合专家(MoE)架构,总参数 671B,每个 token 只激活约 37B。DeepSeek 由梁文锋于 2023 年在杭州创立,以公开发表技术细节和数据著称。V3 在多项基准上接近同期闭源前沿模型,而官方技术报告披露的训练算力与成本远低于同规模模型的常见水平。它支持 128K 量级上下文,权重以宽松许可开放下载。
为什么值得记住
671B 总参数、每 token 仅激活 37B 的 MoE 架构,配合官方报告披露的低训练成本,证明开放权重模型可以逼近同期闭源前沿模型的水平。
关键规格
- 参数规模
- 671B(MoE,激活 37B)
- 上下文窗口
- 128K tokens
- 训练成本
- 约 558 万美元(官方技术报告)
- 开放权重
- 是