Qwen
Eine Open-Weights-Familie über viele Größen hinweg, mit multimodalen Versionen
Der vollständige Artikel liegt auf Englisch vor; Titel und Zusammenfassung sind lokalisiert.
WAS ES IST
Qwen is a language-model series Alibaba began open-sourcing in August 2023. It spans parameters from 0.5B to 72B and covers both text-only and multimodal versions, with the Qwen-VL line accepting image input. Alibaba releases base models alongside instruction-tuned versions and specialised variants for coding and mathematics. Generations such as Qwen2.5 support a context window in the 128K range, with weights downloadable under a permissive licence. Its complete ladder of sizes makes it a widely used base for secondary development in the open-source community.
Warum es wichtig ist
With a full ladder from 0.5B to 72B plus both text and multimodal lines released openly, it lets researchers always find a size that fits their compute — one of the broadest catalogues in the open-weight ecosystem.
Wichtige Eckdaten
- Parameters
- From 0.5B to 72B (Qwen2.5 family)
- Context window
- 128K tokens (Qwen2.5)
- Modality
- Text, image in (Qwen-VL); text out
- Open weights
- Yes
Fähigkeiten
Textgenerierung
Setzt einen Text Wort für Wort fort
Dialog und Instruktionsbefolgung
Absicht über mehrere Züge verstehen und umsetzen
Schlussfolgern und Gedankenkette
Ein schweres Problem in Zwischenschritte zerlegen
Werkzeug- und Funktionsaufruf
Das Modell wählt die API und füllt die Argumente
Verwandte Konzepte
Transformer-Architektur
Statt Wort-für-Wort-Stafette ein Raum, in dem alle zugleich sprechen — und weite Abhängigkeiten sind nur einen Schritt entfernt
Vor- und Feintraining
Erst Sprache aus riesigem ungelabelten Text lernen, dann mit wenig Daten spezialisieren – das dateneffizienteste Paradigma der modernen KI
Tokenisierung
Modelle lesen keine Zeichen, sondern Tokens – und die Zerlegung bestimmt still Fähigkeit wie Kosten
Vergleichbare Produkte
Llama
2023Die Modellfamilie, die offene Gewichte zum Mainstream machte
DeepSeek-V3
2024Ein Open-Weights-MoE mit 671B Parametern, das pro Token nur 37B aktiviert
Mistral Large
2024Das kommerzielle Flaggschiffmodell eines europäischen Open-Weights-Labors
GLM
2023Ein chinesisches Allzweckmodell, das mit autoregressivem Lückenfüllen begann
Phi
2023Kleine, effiziente Modelle aus kuratierten Daten
DeepSeek-R1
2025Ein mit RL auf Gedankenketten trainiertes Schlussfolgerungsmodell, dessen Gewichte unter MIT-Lizenz offen sind
Kimi
2023Ein chinesischer Chat-Assistent, bekannt für langen Kontext
ERNIE
2019Ein chinesisches Modell, das mit wissensverstärktem Vortraining begann – frühe prägende Version
Hunyuan
2023Tencent Generalmodell-Familie mit Open-Weights-Versionen
MiniMax-M
2025Ein Open-Weights-Schlussfolgerungsmodell mit hybridem Attention und einer Million Token Kontext
Yi
2023Ein zweisprachiges (Chinesisch–Englisch) Open-Weights-Modell mit sehr langem Kontext
Baichuan
2023Ein Open-Weights-Allzweckmodell für den chinesischen Sprachraum
DBRX
2024Offenes MoE-Sprachmodell von Databricks