Qwen
Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
Qwen is a language-model series Alibaba began open-sourcing in August 2023. It spans parameters from 0.5B to 72B and covers both text-only and multimodal versions, with the Qwen-VL line accepting image input. Alibaba releases base models alongside instruction-tuned versions and specialised variants for coding and mathematics. Generations such as Qwen2.5 support a context window in the 128K range, with weights downloadable under a permissive licence. Its complete ladder of sizes makes it a widely used base for secondary development in the open-source community.
Pourquoi il compte
With a full ladder from 0.5B to 72B plus both text and multimodal lines released openly, it lets researchers always find a size that fits their compute — one of the broadest catalogues in the open-weight ecosystem.
Caractéristiques clés
- Parameters
- From 0.5B to 72B (Qwen2.5 family)
- Context window
- 128K tokens (Qwen2.5)
- Modality
- Text, image in (Qwen-VL); text out
- Open weights
- Yes
Capacités
Génération de texte
Poursuit un texte mot après mot
Conversation et suivi d’instructions
Comprendre l’intention au fil des tours et agir
Raisonnement et chaîne de pensée
Décomposer un problème difficile en étapes intermédiaires
Appel d’outils et de fonctions
Laisser le modèle choisir l’API et remplir les arguments
Concepts liés
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
Pré-entraînement et affinage
Apprendre d’abord la langue sur d’immenses corpus non annotés, puis se spécialiser avec peu de données : le paradigme le plus économe en données
Tokenisation
Les modèles ne lisent pas des caractères mais des tokens ; le découpage fixe silencieusement la capacité et le coût
Produits comparables
Llama
2023La famille qui a fait des poids ouverts une voie grand public
DeepSeek-V3
2024Un MoE à poids ouverts de 671B paramètres, activant 37B par token
Mistral Large
2024Le modèle commercial phare d’un laboratoire européen de poids ouverts
GLM
2023Un modèle général chinois parti d’un préentraînement par remplissage de blancs autorégressif
Phi
2023Des petits modèles efficaces, bâtis sur des données sélectionnées
DeepSeek-R1
2025Un modèle de raisonnement entraîné par RL sur des chaînes de pensée, à poids ouverts sous licence MIT
Kimi
2023Un assistant de conversation chinois réputé pour les longs contextes
ERNIE
2019Un modèle chinois parti d’un préentraînement enrichi par la connaissance, version phare précoce
Hunyuan
2023La famille de modèles généraux de Tencent, avec des versions à poids ouverts
MiniMax-M
2025Un modèle de raisonnement à poids ouverts, à attention hybride et contexte d’un million de tokens
Yi
2023Un modèle à poids ouverts bilingue chinois-anglais, avec des versions à très long contexte
Baichuan
2023Un modèle général à poids ouverts visant l’usage en chinois
DBRX
2024Modèle de langage MoE à poids ouverts de Databricks