DeepSeek-R1
Un modèle de raisonnement entraîné par RL sur des chaînes de pensée, à poids ouverts sous licence MIT
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
DeepSeek-R1 is a reasoning model DeepSeek released in January 2025 that produces a long chain of thought before answering. It trains the model with reinforcement learning to generate reasoning steps on its own, rather than relying on large sets of human-labelled rationales. R1 shares the architecture scale of the V3 family, releases its weights under the MIT licence and publishes a technical report on its training method. After release, many distilled versions of R1 appeared, transferring its reasoning ability into smaller models.
Pourquoi il compte
It fully open-sourced the weights of a frontier reasoning model under the MIT licence and published a reproducible RL training recipe; the wave of distilled versions that followed changed the cost structure of building one’s own reasoning capability.
Caractéristiques clés
- Parameters
- 671B (MoE, 37B active)
- Context window
- 128K tokens
- Open weights
- Yes (MIT licence)
- Type
- Reasoning model
Capacités
Raisonnement et chaîne de pensée
Décomposer un problème difficile en étapes intermédiaires
Génération de texte
Poursuit un texte mot après mot
Conversation et suivi d’instructions
Comprendre l’intention au fil des tours et agir
Génération de code
Écrire du code exécutable à partir d’une description
Concepts liés
Apprentissage par renforcement à partir de retours humains
Quand la « bonne réponse » ne s’écrit pas en formule, laissons les humains jouer le rôle de la récompense
Ingénierie des prompts et alignement
Rendre un modèle utile, honnête et inoffensif est plus difficile que de simplement l’agrandir
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
Produits comparables
o3
2025Il raisonne longuement avant de répondre : du calcul à l’inférence contre plus de justesse
DeepSeek-V3
2024Un MoE à poids ouverts de 671B paramètres, activant 37B par token
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
MiniMax-M
2025Un modèle de raisonnement à poids ouverts, à attention hybride et contexte d’un million de tokens