GLM
Un modèle général chinois parti d’un préentraînement par remplissage de blancs autorégressif
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
GLM is the general language-model series from Zhipu AI, its name standing for General Language Model and using an autoregressive blank-infilling pretraining objective. GLM-4 arrived in 2024, aimed at dialogue, function calling and agent scenarios and offering general generation in Chinese and other languages. The company grew out of Tsinghua University’s knowledge-engineering lab and was founded in 2019. The GLM family includes commercial versions plus some lightweight open ones, and is widely integrated into Chinese enterprise applications and agent frameworks.
Pourquoi il compte
It started from a blank-infilling pretraining objective different from the standard causal language model, and was early to build function calling and agent abilities into a Chinese model — one of China’s representatives of the open-plus-commercial route.
Caractéristiques clés
- Architecture
- GLM (autoregressive blank infilling)
- Modality
- Text
- Open weights
- No (commercial version)
- Released
- 2023-03
Capacités
Conversation et suivi d’instructions
Comprendre l’intention au fil des tours et agir
Génération de texte
Poursuit un texte mot après mot
Raisonnement et chaîne de pensée
Décomposer un problème difficile en étapes intermédiaires
Appel d’outils et de fonctions
Laisser le modèle choisir l’API et remplir les arguments
Concepts liés
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
Pré-entraînement et affinage
Apprendre d’abord la langue sur d’immenses corpus non annotés, puis se spécialiser avec peu de données : le paradigme le plus économe en données
Ingénierie des prompts et alignement
Rendre un modèle utile, honnête et inoffensif est plus difficile que de simplement l’agrandir
Produits comparables
ERNIE
2019Un modèle chinois parti d’un préentraînement enrichi par la connaissance, version phare précoce
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
Baichuan
2023Un modèle général à poids ouverts visant l’usage en chinois
Doubao
2023Le modèle de conversation général et l’application de ByteDance
Kimi
2023Un assistant de conversation chinois réputé pour les longs contextes
Hunyuan
2023La famille de modèles généraux de Tencent, avec des versions à poids ouverts
MiniMax-M
2025Un modèle de raisonnement à poids ouverts, à attention hybride et contexte d’un million de tokens
Step
2023Une famille de modèles généraux visant le multimodal et l’exécution locale