DeepSeek-R1
Mô hình suy luận huấn luyện bằng RL trên chuỗi suy nghĩ, trọng số mở theo giấy phép MIT
Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NÓ LÀ GÌ
DeepSeek-R1 is a reasoning model DeepSeek released in January 2025 that produces a long chain of thought before answering. It trains the model with reinforcement learning to generate reasoning steps on its own, rather than relying on large sets of human-labelled rationales. R1 shares the architecture scale of the V3 family, releases its weights under the MIT licence and publishes a technical report on its training method. After release, many distilled versions of R1 appeared, transferring its reasoning ability into smaller models.
Vì sao đáng ghi nhớ
It fully open-sourced the weights of a frontier reasoning model under the MIT licence and published a reproducible RL training recipe; the wave of distilled versions that followed changed the cost structure of building one’s own reasoning capability.
Thông số chính
- Parameters
- 671B (MoE, 37B active)
- Context window
- 128K tokens
- Open weights
- Yes (MIT licence)
- Type
- Reasoning model
Năng lực liên quan
Khái niệm liên quan
Học tăng cường từ phản hồi của con người
Khi «câu trả lời tốt» không viết được thành công thức, hãy để con người đóng vai hàm thưởng
Kỹ thuật prompt và căn chỉnh
Làm cho mô hình hữu ích, trung thực và vô hại khó hơn việc chỉ phóng to nó
Kiến trúc Transformer
Thay cách truyền từng từ bằng một phòng họp nơi mọi từ cùng lên tiếng, để phụ thuộc xa chỉ còn cách một bước
Sản phẩm cùng loại
o3
2025Suy luận dài trước khi trả lời, đổi tính toán lúc suy luận lấy độ chính xác ổn định hơn
DeepSeek-V3
2024MoE trọng số mở 671B tham số, chỉ kích hoạt 37B mỗi token
Qwen
2023Dòng trọng số mở với nhiều kích cỡ và bản đa phương thức
MiniMax-M
2025Mô hình suy luận trọng số mở với attention lai và ngữ cảnh một triệu token