Llama
La famille qui a fait des poids ouverts une voie grand public
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
Llama is Meta’s large language model family, first released in February 2023 and distributed as open weights that can be downloaded and run in one’s own environment. From Llama 2 onward, Meta permitted commercial use and offered several sizes such as 7B, 13B and 70B; Llama 3.1 extended the largest version to 405B parameters. It is a pretrained base on which the community performs extensive instruction tuning and domain adaptation. Its open weights made it a default starting point for many open-source projects.
Pourquoi il compte
By releasing large models as open weights under a commercially usable licence, it made “download a base model and fine-tune it yourself” common practice and opened the open-weight camp’s direct competition with the closed frontier.
Caractéristiques clés
- Parameters
- 8B / 70B / 405B (Llama 3.1 family)
- Context window
- 128K tokens (Llama 3.1)
- Open weights
- Yes
- Released
- 2023-02
Capacités
Génération de texte
Poursuit un texte mot après mot
Conversation et suivi d’instructions
Comprendre l’intention au fil des tours et agir
Raisonnement et chaîne de pensée
Décomposer un problème difficile en étapes intermédiaires
Appel d’outils et de fonctions
Laisser le modèle choisir l’API et remplir les arguments
Concepts liés
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
Pré-entraînement et affinage
Apprendre d’abord la langue sur d’immenses corpus non annotés, puis se spécialiser avec peu de données : le paradigme le plus économe en données
Tokenisation
Les modèles ne lisent pas des caractères mais des tokens ; le découpage fixe silencieusement la capacité et le coût
Produits comparables
Mistral Large
2024Le modèle commercial phare d’un laboratoire européen de poids ouverts
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
DeepSeek-V3
2024Un MoE à poids ouverts de 671B paramètres, activant 37B par token
GPT-4o
2024Un modèle général nativement multimodal : texte, image et audio par une même entrée
Claude
2023Un modèle de conversation général réputé pour son long contexte et son alignement sécurisé
Gemini
2023Un modèle général nativement multimodal, conçu pour de très longs contextes
Phi
2023Des petits modèles efficaces, bâtis sur des données sélectionnées
Command R
2024Un modèle commercial conçu pour la recherche augmentée et l’usage d’outils
Jamba
2024Un modèle à poids ouverts mêlant un modèle d’espace d’états à un Transformer
Yi
2023Un modèle à poids ouverts bilingue chinois-anglais, avec des versions à très long contexte
DBRX
2024Modèle de langage MoE à poids ouverts de Databricks