MiniMax-M
Ein Open-Weights-Schlussfolgerungsmodell mit hybridem Attention und einer Million Token Kontext
Der vollständige Artikel liegt auf Englisch vor; Titel und Zusammenfassung sind lokalisiert.
WAS ES IST
MiniMax-M1 is an open-weight reasoning model MiniMax released in June 2025. MiniMax was founded in Shanghai in 2021 by Yan Junjie and others. M1 uses a hybrid attention design that combines standard full-attention layers with linear-attention layers to cut the compute cost of long-sequence reasoning, and its stated context window reaches the million-token range. With 456B total parameters activating about 46B per token, it is a large-scale MoE reasoning model whose weights are released under an open licence. The company also runs generation product lines such as Hailuo.
Warum es wichtig ist
It mixes linear and full attention and pushes context to a million tokens to cut the cost of long-sequence reasoning; among the larger open-weight reasoning models, it is a concrete landing of the open-weight camp on the reasoning track.
Wichtige Eckdaten
- Parameters
- 456B (MoE, ~46B active)
- Context window
- 1M tokens
- Architecture
- Hybrid linear and full attention
- Open weights
- Yes
Fähigkeiten
Schlussfolgern und Gedankenkette
Ein schweres Problem in Zwischenschritte zerlegen
Textgenerierung
Setzt einen Text Wort für Wort fort
Dialog und Instruktionsbefolgung
Absicht über mehrere Züge verstehen und umsetzen
Werkzeug- und Funktionsaufruf
Das Modell wählt die API und füllt die Argumente
Verwandte Konzepte
Transformer-Architektur
Statt Wort-für-Wort-Stafette ein Raum, in dem alle zugleich sprechen — und weite Abhängigkeiten sind nur einen Schritt entfernt
Attention-Mechanismus
Jede Position kann direkt auf alle anderen blicken und ihre Aufmerksamkeit nach Relevanz verteilen
Bestärkendes Lernen aus menschlichem Feedback
Wenn die „gute Antwort" keine Formel hat, übernehmen Menschen die Rolle der Belohnungsfunktion
Vergleichbare Produkte
DeepSeek-R1
2025Ein mit RL auf Gedankenketten trainiertes Schlussfolgerungsmodell, dessen Gewichte unter MIT-Lizenz offen sind
Qwen
2023Eine Open-Weights-Familie über viele Größen hinweg, mit multimodalen Versionen
o3
2025Es denkt lange nach, bevor es antwortet: Rechenzeit bei der Inferenz gegen mehr Treffsicherheit
GLM
2023Ein chinesisches Allzweckmodell, das mit autoregressivem Lückenfüllen begann
Doubao
2023ByteDances allgemeines Dialogmodell und App
Step
2023Eine Allzweck-Modellfamilie für Multimodalität und On-Device-Betrieb