MiniMax-M
Mô hình suy luận trọng số mở với attention lai và ngữ cảnh một triệu token
Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NÓ LÀ GÌ
MiniMax-M1 is an open-weight reasoning model MiniMax released in June 2025. MiniMax was founded in Shanghai in 2021 by Yan Junjie and others. M1 uses a hybrid attention design that combines standard full-attention layers with linear-attention layers to cut the compute cost of long-sequence reasoning, and its stated context window reaches the million-token range. With 456B total parameters activating about 46B per token, it is a large-scale MoE reasoning model whose weights are released under an open licence. The company also runs generation product lines such as Hailuo.
Vì sao đáng ghi nhớ
It mixes linear and full attention and pushes context to a million tokens to cut the cost of long-sequence reasoning; among the larger open-weight reasoning models, it is a concrete landing of the open-weight camp on the reasoning track.
Thông số chính
- Parameters
- 456B (MoE, ~46B active)
- Context window
- 1M tokens
- Architecture
- Hybrid linear and full attention
- Open weights
- Yes
Năng lực liên quan
Suy luận và chuỗi tư duy
Chia bài toán khó thành các bước trung gian
Sinh văn bản
Viết tiếp văn bản từng từ một
Hội thoại và tuân thủ chỉ dẫn
Hiểu ý định qua các lượt hội thoại và thực hiện
Gọi công cụ và gọi hàm
Để mô hình chọn API và điền tham số
Khái niệm liên quan
Kiến trúc Transformer
Thay cách truyền từng từ bằng một phòng họp nơi mọi từ cùng lên tiếng, để phụ thuộc xa chỉ còn cách một bước
Cơ chế chú ý (Attention)
Mọi vị trí đều có thể nhìn thẳng vào mọi vị trí khác và phân bổ chú ý theo mức liên quan
Học tăng cường từ phản hồi của con người
Khi «câu trả lời tốt» không viết được thành công thức, hãy để con người đóng vai hàm thưởng
Sản phẩm cùng loại
DeepSeek-R1
2025Mô hình suy luận huấn luyện bằng RL trên chuỗi suy nghĩ, trọng số mở theo giấy phép MIT
Qwen
2023Dòng trọng số mở với nhiều kích cỡ và bản đa phương thức
o3
2025Suy luận dài trước khi trả lời, đổi tính toán lúc suy luận lấy độ chính xác ổn định hơn
GLM
2023Mô hình phổ thông tiếng Trung khởi đầu bằng tiền huấn luyện điền khuyết tự hồi quy
Doubao
2023Mô hình hội thoại phổ thông và ứng dụng của ByteDance
Step
2023Dòng mô hình phổ thông hướng tới đa phương thức và chạy trên thiết bị