DeepSeek-V3
Ein Open-Weights-MoE mit 671B Parametern, das pro Token nur 37B aktiviert
Der vollständige Artikel liegt auf Englisch vor; Titel und Zusammenfassung sind lokalisiert.
WAS ES IST
DeepSeek-V3 is an open-weight model DeepSeek released in December 2024. It uses a mixture-of-experts architecture with 671B total parameters, activating about 37B per token. DeepSeek was founded in Hangzhou in 2023 by Liang Wenfeng and is known for publishing technical details and data openly. V3 approaches the closed frontier of its time on several benchmarks, while the training compute and cost disclosed in its technical report are far below the usual level for models of this size. It supports a context window in the 128K range, with weights downloadable under a permissive licence.
Warum es wichtig ist
A 671B-parameter MoE that activates only 37B per token, trained at the low cost reported in its technical report — evidence that open-weight models can approach the closed frontier of the same period.
Wichtige Eckdaten
- Parameters
- 671B (MoE, 37B active)
- Context window
- 128K tokens
- Training cost
- About US$5.58M (per the official technical report)
- Open weights
- Yes
Fähigkeiten
Textgenerierung
Setzt einen Text Wort für Wort fort
Dialog und Instruktionsbefolgung
Absicht über mehrere Züge verstehen und umsetzen
Schlussfolgern und Gedankenkette
Ein schweres Problem in Zwischenschritte zerlegen
Codegenerierung
Aus einer Beschreibung lauffähigen Code schreiben
Verwandte Konzepte
Transformer-Architektur
Statt Wort-für-Wort-Stafette ein Raum, in dem alle zugleich sprechen — und weite Abhängigkeiten sind nur einen Schritt entfernt
Vor- und Feintraining
Erst Sprache aus riesigem ungelabelten Text lernen, dann mit wenig Daten spezialisieren – das dateneffizienteste Paradigma der modernen KI
Attention-Mechanismus
Jede Position kann direkt auf alle anderen blicken und ihre Aufmerksamkeit nach Relevanz verteilen
Vergleichbare Produkte
DeepSeek-R1
2025Ein mit RL auf Gedankenketten trainiertes Schlussfolgerungsmodell, dessen Gewichte unter MIT-Lizenz offen sind
Llama
2023Die Modellfamilie, die offene Gewichte zum Mainstream machte
Qwen
2023Eine Open-Weights-Familie über viele Größen hinweg, mit multimodalen Versionen
Mistral Large
2024Das kommerzielle Flaggschiffmodell eines europäischen Open-Weights-Labors
Baichuan
2023Ein Open-Weights-Allzweckmodell für den chinesischen Sprachraum