Qwen
Семейство с открытыми весами, охватывающее разные размеры и мультимодальные версии
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
Qwen is a language-model series Alibaba began open-sourcing in August 2023. It spans parameters from 0.5B to 72B and covers both text-only and multimodal versions, with the Qwen-VL line accepting image input. Alibaba releases base models alongside instruction-tuned versions and specialised variants for coding and mathematics. Generations such as Qwen2.5 support a context window in the 128K range, with weights downloadable under a permissive licence. Its complete ladder of sizes makes it a widely used base for secondary development in the open-source community.
Почему стоит запомнить
With a full ladder from 0.5B to 72B plus both text and multimodal lines released openly, it lets researchers always find a size that fits their compute — one of the broadest catalogues in the open-weight ecosystem.
Ключевые характеристики
- Parameters
- From 0.5B to 72B (Qwen2.5 family)
- Context window
- 128K tokens (Qwen2.5)
- Modality
- Text, image in (Qwen-VL); text out
- Open weights
- Yes
Возможности
Генерация текста
Продолжает текст слово за словом
Диалог и следование инструкциям
Понимать намерение по ходу диалога и выполнять его
Рассуждение и цепочка мыслей
Разбить трудную задачу на промежуточные шаги
Вызов инструментов и функций
Пусть модель выберет API и заполнит аргументы
Связанные концепции
Архитектура Transformer
Замена эстафеты по одному слову залом, где все говорят сразу, — и дальние зависимости оказываются в одном шаге
Предобучение и дообучение
Сначала выучить язык на огромных неразмеченных корпусах, затем специализироваться на малых данных — самый экономный по данным подход в современном ИИ
Токенизация
Модель читает не символы, а токены — способ разбиения тихо определяет и возможности, и стоимость
Аналоги
Llama
2023Семейство моделей, сделавшее открытые веса массовым путём
DeepSeek-V3
2024MoE с открытыми весами на 671B параметров, активирующий 37B на токен
Mistral Large
2024Флагманская коммерческая модель европейской лаборатории открытых весов
GLM
2023Китайская универсальная модель, начавшая с авторегрессивного заполнения пропусков
Phi
2023Небольшие эффективные модели, построенные на отобранных данных
DeepSeek-R1
2025Модель рассуждений, обученная RL на цепочках мыслей, с открытыми весами под лицензией MIT
Kimi
2023Китайский чат-ассистент, известный работой с длинным контекстом
ERNIE
2019Китайская модель, начавшая с обогащённого знаниями предобучения, ранняя заметная версия
Hunyuan
2023Семейство универсальных моделей Tencent с открытыми весами
MiniMax-M
2025Модель рассуждений с открытыми весами, гибридным вниманием и контекстом в миллион токенов
Yi
2023Двуязычная (китайско-английская) модель с открытыми весами и очень длинным контекстом
Baichuan
2023Универсальная модель с открытыми весами для китайского языка
DBRX
2024Языковая MoE-модель с открытыми весами от Databricks