MiniMax-M
Um modelo de raciocínio de pesos abertos com atenção híbrida e contexto de um milhão de tokens
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
MiniMax-M1 is an open-weight reasoning model MiniMax released in June 2025. MiniMax was founded in Shanghai in 2021 by Yan Junjie and others. M1 uses a hybrid attention design that combines standard full-attention layers with linear-attention layers to cut the compute cost of long-sequence reasoning, and its stated context window reaches the million-token range. With 456B total parameters activating about 46B per token, it is a large-scale MoE reasoning model whose weights are released under an open licence. The company also runs generation product lines such as Hailuo.
Por que vale a pena lembrar
It mixes linear and full attention and pushes context to a million tokens to cut the cost of long-sequence reasoning; among the larger open-weight reasoning models, it is a concrete landing of the open-weight camp on the reasoning track.
Especificações-chave
- Parameters
- 456B (MoE, ~46B active)
- Context window
- 1M tokens
- Architecture
- Hybrid linear and full attention
- Open weights
- Yes
Capacidades
Raciocínio e cadeia de pensamento
Decompor um problema difícil em passos intermediários
Geração de texto
Continua um texto palavra a palavra
Conversa e seguimento de instruções
Entender a intenção ao longo do diálogo e agir
Uso de ferramentas e chamada de funções
Deixar o modelo escolher a API e preencher os argumentos
Conceitos relacionados
Arquitetura Transformer
Substituir o revezamento palavra a palavra por uma sala onde todos falam ao mesmo tempo, deixando dependências distantes a um salto
Mecanismo de atenção
Cada posição pode olhar diretamente para todas as outras e distribuir atenção conforme a relevância
Aprendizado por reforço a partir de feedback humano
Quando a «boa resposta» não cabe numa fórmula, deixe as pessoas servirem de recompensa
Produtos semelhantes
DeepSeek-R1
2025Um modelo de raciocínio treinado com RL sobre cadeias de pensamento, com pesos abertos sob licença MIT
Qwen
2023Uma família de pesos abertos com muitos tamanhos e versões multimodais
o3
2025Raciocina longamente antes de responder, trocando computação na inferência por mais acerto
GLM
2023Um modelo geral chinês que começou com pré-treinamento de preenchimento de lacunas autorregressivo
Doubao
2023O modelo de conversa geral e o aplicativo da ByteDance
Step
2023Uma família de modelos gerais voltada à multimodalidade e ao uso no dispositivo