GLM
Um modelo geral chinês que começou com pré-treinamento de preenchimento de lacunas autorregressivo
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
GLM is the general language-model series from Zhipu AI, its name standing for General Language Model and using an autoregressive blank-infilling pretraining objective. GLM-4 arrived in 2024, aimed at dialogue, function calling and agent scenarios and offering general generation in Chinese and other languages. The company grew out of Tsinghua University’s knowledge-engineering lab and was founded in 2019. The GLM family includes commercial versions plus some lightweight open ones, and is widely integrated into Chinese enterprise applications and agent frameworks.
Por que vale a pena lembrar
It started from a blank-infilling pretraining objective different from the standard causal language model, and was early to build function calling and agent abilities into a Chinese model — one of China’s representatives of the open-plus-commercial route.
Especificações-chave
- Architecture
- GLM (autoregressive blank infilling)
- Modality
- Text
- Open weights
- No (commercial version)
- Released
- 2023-03
Capacidades
Conversa e seguimento de instruções
Entender a intenção ao longo do diálogo e agir
Geração de texto
Continua um texto palavra a palavra
Raciocínio e cadeia de pensamento
Decompor um problema difícil em passos intermediários
Uso de ferramentas e chamada de funções
Deixar o modelo escolher a API e preencher os argumentos
Conceitos relacionados
Arquitetura Transformer
Substituir o revezamento palavra a palavra por uma sala onde todos falam ao mesmo tempo, deixando dependências distantes a um salto
Pré-treinamento e ajuste fino
Aprender a língua primeiro com texto não rotulado e depois especializar com poucos dados: o paradigma mais eficiente em dados da IA moderna
Engenharia de prompts e alinhamento
Tornar um modelo útil, honesto e inofensivo é mais difícil do que apenas torná-lo maior
Produtos semelhantes
ERNIE
2019Um modelo chinês que começou com pré-treinamento enriquecido por conhecimento, versão inicial representativa
Qwen
2023Uma família de pesos abertos com muitos tamanhos e versões multimodais
Baichuan
2023Um modelo geral de pesos abertos voltado ao uso em chinês
Doubao
2023O modelo de conversa geral e o aplicativo da ByteDance
Kimi
2023Um assistente de conversa chinês conhecido por lidar com contextos longos
Hunyuan
2023A família de modelos gerais da Tencent, com versões de pesos abertos
MiniMax-M
2025Um modelo de raciocínio de pesos abertos com atenção híbrida e contexto de um milhão de tokens
Step
2023Uma família de modelos gerais voltada à multimodalidade e ao uso no dispositivo