Mistral Large
Le modèle commercial phare d’un laboratoire européen de poids ouverts
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
Mistral Large is the flagship model that France’s Mistral AI released in February 2024, offered under a commercial licence rather than open weights, complementing its open small models. Mistral AI was founded in 2023 in Paris by former DeepMind and Meta researchers. The model targets reasoning, multilingual work and function calling, with a context window in the 128K range. Mistral builds a community with a handful of open models, then serves enterprise needs with commercial ones such as Large.
Pourquoi il compte
It represents the dual-track strategy of open-sourcing small models to win a community and selling flagship models commercially, letting a non-US lab hold ground on both the open-weight and commercial sides.
Caractéristiques clés
- Parameters
- 123B (Mistral Large 2)
- Context window
- 128K tokens
- Open weights
- No (commercial licence)
- Released
- 2024-02
Capacités
Génération de texte
Poursuit un texte mot après mot
Conversation et suivi d’instructions
Comprendre l’intention au fil des tours et agir
Raisonnement et chaîne de pensée
Décomposer un problème difficile en étapes intermédiaires
Appel d’outils et de fonctions
Laisser le modèle choisir l’API et remplir les arguments
Concepts liés
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
Mécanisme d’attention
Chaque position peut regarder directement toutes les autres et répartir dynamiquement son attention selon la pertinence
Pré-entraînement et affinage
Apprendre d’abord la langue sur d’immenses corpus non annotés, puis se spécialiser avec peu de données : le paradigme le plus économe en données
Produits comparables
Llama
2023La famille qui a fait des poids ouverts une voie grand public
GPT-4o
2024Un modèle général nativement multimodal : texte, image et audio par une même entrée
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
Command R
2024Un modèle commercial conçu pour la recherche augmentée et l’usage d’outils
Phi
2023Des petits modèles efficaces, bâtis sur des données sélectionnées
Jamba
2024Un modèle à poids ouverts mêlant un modèle d’espace d’états à un Transformer
DeepSeek-V3
2024Un MoE à poids ouverts de 671B paramètres, activant 37B par token
Yi
2023Un modèle à poids ouverts bilingue chinois-anglais, avec des versions à très long contexte
DBRX
2024Modèle de langage MoE à poids ouverts de Databricks