MiniMax-M
Un modelo de razonamiento de pesos abiertos con atención híbrida y contexto de un millón de tokens
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
MiniMax-M1 is an open-weight reasoning model MiniMax released in June 2025. MiniMax was founded in Shanghai in 2021 by Yan Junjie and others. M1 uses a hybrid attention design that combines standard full-attention layers with linear-attention layers to cut the compute cost of long-sequence reasoning, and its stated context window reaches the million-token range. With 456B total parameters activating about 46B per token, it is a large-scale MoE reasoning model whose weights are released under an open licence. The company also runs generation product lines such as Hailuo.
Por qué merece la pena recordarlo
It mixes linear and full attention and pushes context to a million tokens to cut the cost of long-sequence reasoning; among the larger open-weight reasoning models, it is a concrete landing of the open-weight camp on the reasoning track.
Especificaciones clave
- Parameters
- 456B (MoE, ~46B active)
- Context window
- 1M tokens
- Architecture
- Hybrid linear and full attention
- Open weights
- Yes
Capacidades
Razonamiento y cadena de pensamiento
Descomponer un problema difícil en pasos intermedios
Generación de texto
Continúa un texto palabra por palabra
Conversación y seguimiento de instrucciones
Entender la intención en el diálogo y actuar en consecuencia
Uso de herramientas y function calling
Que el modelo elija la API y rellene los argumentos
Conceptos relacionados
Arquitectura Transformer
Sustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto
Mecanismo de atención
Cada posición puede mirar directamente a todas las demás y repartir su atención según la relevancia
Aprendizaje por refuerzo a partir de retroalimentación humana
Cuando la «buena respuesta» no cabe en una fórmula, deja que las personas actúen como recompensa
Productos similares
DeepSeek-R1
2025Un modelo de razonamiento entrenado con RL sobre cadenas de pensamiento, con pesos abiertos bajo licencia MIT
Qwen
2023Una familia de pesos abiertos con muchos tamaños y versiones multimodales
o3
2025Razona largamente antes de responder: cambia cómputo en inferencia por más aciertos
GLM
2023Un modelo general chino que comenzó con preentrenamiento de relleno de espacios autorregresivo
Doubao
2023El modelo de chat general y la aplicación de ByteDance
Step
2023Una familia de modelos generales orientada a la multimodalidad y el uso en dispositivo