MiniMax-M
Модель рассуждений с открытыми весами, гибридным вниманием и контекстом в миллион токенов
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
MiniMax-M1 is an open-weight reasoning model MiniMax released in June 2025. MiniMax was founded in Shanghai in 2021 by Yan Junjie and others. M1 uses a hybrid attention design that combines standard full-attention layers with linear-attention layers to cut the compute cost of long-sequence reasoning, and its stated context window reaches the million-token range. With 456B total parameters activating about 46B per token, it is a large-scale MoE reasoning model whose weights are released under an open licence. The company also runs generation product lines such as Hailuo.
Почему стоит запомнить
It mixes linear and full attention and pushes context to a million tokens to cut the cost of long-sequence reasoning; among the larger open-weight reasoning models, it is a concrete landing of the open-weight camp on the reasoning track.
Ключевые характеристики
- Parameters
- 456B (MoE, ~46B active)
- Context window
- 1M tokens
- Architecture
- Hybrid linear and full attention
- Open weights
- Yes
Возможности
Рассуждение и цепочка мыслей
Разбить трудную задачу на промежуточные шаги
Генерация текста
Продолжает текст слово за словом
Диалог и следование инструкциям
Понимать намерение по ходу диалога и выполнять его
Вызов инструментов и функций
Пусть модель выберет API и заполнит аргументы
Связанные концепции
Архитектура Transformer
Замена эстафеты по одному слову залом, где все говорят сразу, — и дальние зависимости оказываются в одном шаге
Механизм внимания
Каждая позиция может напрямую «видеть» все остальные и динамически распределять внимание по релевантности
Обучение с подкреплением на основе обратной связи от людей
Когда «хороший ответ» не выразить формулой, роль функции награды берут на себя люди
Аналоги
DeepSeek-R1
2025Модель рассуждений, обученная RL на цепочках мыслей, с открытыми весами под лицензией MIT
Qwen
2023Семейство с открытыми весами, охватывающее разные размеры и мультимодальные версии
o3
2025Сначала длинная цепочка рассуждений, затем ответ: вычисления на выводе в обмен на точность
GLM
2023Китайская универсальная модель, начавшая с авторегрессивного заполнения пропусков
Doubao
2023Универсальная диалоговая модель и приложение ByteDance
Step
2023Семейство универсальных моделей для мультимодальности и работы на устройстве