MiniMax-M
Un modèle de raisonnement à poids ouverts, à attention hybride et contexte d’un million de tokens
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
MiniMax-M1 is an open-weight reasoning model MiniMax released in June 2025. MiniMax was founded in Shanghai in 2021 by Yan Junjie and others. M1 uses a hybrid attention design that combines standard full-attention layers with linear-attention layers to cut the compute cost of long-sequence reasoning, and its stated context window reaches the million-token range. With 456B total parameters activating about 46B per token, it is a large-scale MoE reasoning model whose weights are released under an open licence. The company also runs generation product lines such as Hailuo.
Pourquoi il compte
It mixes linear and full attention and pushes context to a million tokens to cut the cost of long-sequence reasoning; among the larger open-weight reasoning models, it is a concrete landing of the open-weight camp on the reasoning track.
Caractéristiques clés
- Parameters
- 456B (MoE, ~46B active)
- Context window
- 1M tokens
- Architecture
- Hybrid linear and full attention
- Open weights
- Yes
Capacités
Raisonnement et chaîne de pensée
Décomposer un problème difficile en étapes intermédiaires
Génération de texte
Poursuit un texte mot après mot
Conversation et suivi d’instructions
Comprendre l’intention au fil des tours et agir
Appel d’outils et de fonctions
Laisser le modèle choisir l’API et remplir les arguments
Concepts liés
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
Mécanisme d’attention
Chaque position peut regarder directement toutes les autres et répartir dynamiquement son attention selon la pertinence
Apprentissage par renforcement à partir de retours humains
Quand la « bonne réponse » ne s’écrit pas en formule, laissons les humains jouer le rôle de la récompense
Produits comparables
DeepSeek-R1
2025Un modèle de raisonnement entraîné par RL sur des chaînes de pensée, à poids ouverts sous licence MIT
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
o3
2025Il raisonne longuement avant de répondre : du calcul à l’inférence contre plus de justesse
GLM
2023Un modèle général chinois parti d’un préentraînement par remplissage de blancs autorégressif
Doubao
2023Le modèle de conversation général et l’application de ByteDance
Step
2023Une famille de modèles généraux visant le multimodal et l’exécution locale