Qwen
Una familia de pesos abiertos con muchos tamaños y versiones multimodales
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
Qwen is a language-model series Alibaba began open-sourcing in August 2023. It spans parameters from 0.5B to 72B and covers both text-only and multimodal versions, with the Qwen-VL line accepting image input. Alibaba releases base models alongside instruction-tuned versions and specialised variants for coding and mathematics. Generations such as Qwen2.5 support a context window in the 128K range, with weights downloadable under a permissive licence. Its complete ladder of sizes makes it a widely used base for secondary development in the open-source community.
Por qué merece la pena recordarlo
With a full ladder from 0.5B to 72B plus both text and multimodal lines released openly, it lets researchers always find a size that fits their compute — one of the broadest catalogues in the open-weight ecosystem.
Especificaciones clave
- Parameters
- From 0.5B to 72B (Qwen2.5 family)
- Context window
- 128K tokens (Qwen2.5)
- Modality
- Text, image in (Qwen-VL); text out
- Open weights
- Yes
Capacidades
Generación de texto
Continúa un texto palabra por palabra
Conversación y seguimiento de instrucciones
Entender la intención en el diálogo y actuar en consecuencia
Razonamiento y cadena de pensamiento
Descomponer un problema difícil en pasos intermedios
Uso de herramientas y function calling
Que el modelo elija la API y rellene los argumentos
Conceptos relacionados
Arquitectura Transformer
Sustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto
Preentrenamiento y ajuste fino
Aprender el lenguaje primero con texto sin etiquetas y luego especializarse con pocos datos: el paradigma más eficiente en datos de la IA moderna
Tokenización
Los modelos no leen caracteres, leen tokens; y cómo los dividas decide en silencio capacidad y coste
Productos similares
Llama
2023La familia que llevó la ruta de pesos abiertos a la corriente principal
DeepSeek-V3
2024Un MoE de pesos abiertos con 671B parámetros, activando 37B por token
Mistral Large
2024El modelo comercial insignia de un laboratorio europeo de pesos abiertos
GLM
2023Un modelo general chino que comenzó con preentrenamiento de relleno de espacios autorregresivo
Phi
2023Modelos pequeños y eficientes construidos con datos seleccionados
DeepSeek-R1
2025Un modelo de razonamiento entrenado con RL sobre cadenas de pensamiento, con pesos abiertos bajo licencia MIT
Kimi
2023Un asistente de chat chino conocido por manejar contextos largos
ERNIE
2019Un modelo chino que comenzó con preentrenamiento enriquecido con conocimiento, versión temprana representativa
Hunyuan
2023La familia de modelos generales de Tencent, con versiones de pesos abiertos
MiniMax-M
2025Un modelo de razonamiento de pesos abiertos con atención híbrida y contexto de un millón de tokens
Yi
2023Un modelo de pesos abiertos bilingüe chino-inglés, con versiones de contexto muy largo
Baichuan
2023Un modelo general de pesos abiertos orientado al uso en chino
DBRX
2024Modelo de lenguaje MoE de pesos abiertos de Databricks