Qwen
Uma família de pesos abertos com muitos tamanhos e versões multimodais
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
Qwen is a language-model series Alibaba began open-sourcing in August 2023. It spans parameters from 0.5B to 72B and covers both text-only and multimodal versions, with the Qwen-VL line accepting image input. Alibaba releases base models alongside instruction-tuned versions and specialised variants for coding and mathematics. Generations such as Qwen2.5 support a context window in the 128K range, with weights downloadable under a permissive licence. Its complete ladder of sizes makes it a widely used base for secondary development in the open-source community.
Por que vale a pena lembrar
With a full ladder from 0.5B to 72B plus both text and multimodal lines released openly, it lets researchers always find a size that fits their compute — one of the broadest catalogues in the open-weight ecosystem.
Especificações-chave
- Parameters
- From 0.5B to 72B (Qwen2.5 family)
- Context window
- 128K tokens (Qwen2.5)
- Modality
- Text, image in (Qwen-VL); text out
- Open weights
- Yes
Capacidades
Geração de texto
Continua um texto palavra a palavra
Conversa e seguimento de instruções
Entender a intenção ao longo do diálogo e agir
Raciocínio e cadeia de pensamento
Decompor um problema difícil em passos intermediários
Uso de ferramentas e chamada de funções
Deixar o modelo escolher a API e preencher os argumentos
Conceitos relacionados
Arquitetura Transformer
Substituir o revezamento palavra a palavra por uma sala onde todos falam ao mesmo tempo, deixando dependências distantes a um salto
Pré-treinamento e ajuste fino
Aprender a língua primeiro com texto não rotulado e depois especializar com poucos dados: o paradigma mais eficiente em dados da IA moderna
Tokenização
Os modelos não leem caracteres, leem tokens; e como você divide define silenciosamente a capacidade e o custo
Produtos semelhantes
Llama
2023A família que tornou a rota de pesos abertos mainstream
DeepSeek-V3
2024Um MoE de pesos abertos com 671B parâmetros, ativando 37B por token
Mistral Large
2024O modelo comercial principal de um laboratório europeu de pesos abertos
GLM
2023Um modelo geral chinês que começou com pré-treinamento de preenchimento de lacunas autorregressivo
Phi
2023Modelos pequenos e eficientes, construídos com dados selecionados
DeepSeek-R1
2025Um modelo de raciocínio treinado com RL sobre cadeias de pensamento, com pesos abertos sob licença MIT
Kimi
2023Um assistente de conversa chinês conhecido por lidar com contextos longos
ERNIE
2019Um modelo chinês que começou com pré-treinamento enriquecido por conhecimento, versão inicial representativa
Hunyuan
2023A família de modelos gerais da Tencent, com versões de pesos abertos
MiniMax-M
2025Um modelo de raciocínio de pesos abertos com atenção híbrida e contexto de um milhão de tokens
Yi
2023Um modelo de pesos abertos bilíngue chinês-inglês, com versões de contexto muito longo
Baichuan
2023Um modelo geral de pesos abertos voltado ao uso em chinês
DBRX
2024Modelo de linguagem MoE de pesos abertos da Databricks