DeepSeek-V3
Un MoE à poids ouverts de 671B paramètres, activant 37B par token
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
DeepSeek-V3 is an open-weight model DeepSeek released in December 2024. It uses a mixture-of-experts architecture with 671B total parameters, activating about 37B per token. DeepSeek was founded in Hangzhou in 2023 by Liang Wenfeng and is known for publishing technical details and data openly. V3 approaches the closed frontier of its time on several benchmarks, while the training compute and cost disclosed in its technical report are far below the usual level for models of this size. It supports a context window in the 128K range, with weights downloadable under a permissive licence.
Pourquoi il compte
A 671B-parameter MoE that activates only 37B per token, trained at the low cost reported in its technical report — evidence that open-weight models can approach the closed frontier of the same period.
Caractéristiques clés
- Parameters
- 671B (MoE, 37B active)
- Context window
- 128K tokens
- Training cost
- About US$5.58M (per the official technical report)
- Open weights
- Yes
Capacités
Génération de texte
Poursuit un texte mot après mot
Conversation et suivi d’instructions
Comprendre l’intention au fil des tours et agir
Raisonnement et chaîne de pensée
Décomposer un problème difficile en étapes intermédiaires
Génération de code
Écrire du code exécutable à partir d’une description
Concepts liés
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
Pré-entraînement et affinage
Apprendre d’abord la langue sur d’immenses corpus non annotés, puis se spécialiser avec peu de données : le paradigme le plus économe en données
Mécanisme d’attention
Chaque position peut regarder directement toutes les autres et répartir dynamiquement son attention selon la pertinence
Produits comparables
DeepSeek-R1
2025Un modèle de raisonnement entraîné par RL sur des chaînes de pensée, à poids ouverts sous licence MIT
Llama
2023La famille qui a fait des poids ouverts une voie grand public
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
Mistral Large
2024Le modèle commercial phare d’un laboratoire européen de poids ouverts
Baichuan
2023Un modèle général à poids ouverts visant l’usage en chinois