DeepSeek-R1
Ein mit RL auf Gedankenketten trainiertes Schlussfolgerungsmodell, dessen Gewichte unter MIT-Lizenz offen sind
Der vollständige Artikel liegt auf Englisch vor; Titel und Zusammenfassung sind lokalisiert.
WAS ES IST
DeepSeek-R1 is a reasoning model DeepSeek released in January 2025 that produces a long chain of thought before answering. It trains the model with reinforcement learning to generate reasoning steps on its own, rather than relying on large sets of human-labelled rationales. R1 shares the architecture scale of the V3 family, releases its weights under the MIT licence and publishes a technical report on its training method. After release, many distilled versions of R1 appeared, transferring its reasoning ability into smaller models.
Warum es wichtig ist
It fully open-sourced the weights of a frontier reasoning model under the MIT licence and published a reproducible RL training recipe; the wave of distilled versions that followed changed the cost structure of building one’s own reasoning capability.
Wichtige Eckdaten
- Parameters
- 671B (MoE, 37B active)
- Context window
- 128K tokens
- Open weights
- Yes (MIT licence)
- Type
- Reasoning model
Fähigkeiten
Schlussfolgern und Gedankenkette
Ein schweres Problem in Zwischenschritte zerlegen
Textgenerierung
Setzt einen Text Wort für Wort fort
Dialog und Instruktionsbefolgung
Absicht über mehrere Züge verstehen und umsetzen
Codegenerierung
Aus einer Beschreibung lauffähigen Code schreiben
Verwandte Konzepte
Bestärkendes Lernen aus menschlichem Feedback
Wenn die „gute Antwort" keine Formel hat, übernehmen Menschen die Rolle der Belohnungsfunktion
Prompt-Engineering und Alignment
Ein Modell hilfreich, ehrlich und harmlos zu machen ist schwieriger, als es einfach größer zu machen
Transformer-Architektur
Statt Wort-für-Wort-Stafette ein Raum, in dem alle zugleich sprechen — und weite Abhängigkeiten sind nur einen Schritt entfernt
Vergleichbare Produkte
o3
2025Es denkt lange nach, bevor es antwortet: Rechenzeit bei der Inferenz gegen mehr Treffsicherheit
DeepSeek-V3
2024Ein Open-Weights-MoE mit 671B Parametern, das pro Token nur 37B aktiviert
Qwen
2023Eine Open-Weights-Familie über viele Größen hinweg, mit multimodalen Versionen
MiniMax-M
2025Ein Open-Weights-Schlussfolgerungsmodell mit hybridem Attention und einer Million Token Kontext