Диалог и следование инструкциям
Понимать намерение по ходу диалога и выполнять его
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО ЗА ВОЗМОЖНОСТЬ
Takes a multi-turn message sequence with roles (system, user, assistant) and outputs the next assistant turn. It is not merely continuation: the model must hold a persona across turns, remember earlier constraints, and obey format and tone instructions. It differs from plain text generation by its explicit role structure and the demand to follow instructions.
Как это устроено
The base is the same autoregressive language model; the difference lies in chat templates and post-training. System prompts and history are concatenated into a fixed sequence of special tokens, then instruction tuning teaches the model to answer rather than continue a web page. Preference data then shapes it through RLHF or a direct-preference method to favour helpful, harmless and honest behaviour. Tools and memory are injected into the prompt by external systems.
Примеры продуктов
30ChatGPT
2022Окно диалога, которое сделало большую языковую модель доступной каждому
Claude
2023Универсальная диалоговая модель, известная длинным контекстом и выравниванием по безопасности
Gemini
2024Единое окно диалога, собравшее поиск, офисные приложения и мультимодальную модель
Kimi
2023Китайский чат-ассистент, известный работой с длинным контекстом
Doubao
2023Универсальная диалоговая модель и приложение ByteDance
Character.AI
2022Ролевой чат с персонажами, которых вы задаёте и с которыми говорите долго
Microsoft Copilot
2023Разговорный ИИ, встроенный в операционную систему и офисные приложения
MiniMax-M
2025Модель рассуждений с открытыми весами, гибридным вниманием и контекстом в миллион токенов
o3
2025Сначала длинная цепочка рассуждений, затем ответ: вычисления на выводе в обмен на точность
DeepSeek-R1
2025Модель рассуждений, обученная RL на цепочках мыслей, с открытыми весами под лицензией MIT
DeepSeek-V3
2024MoE с открытыми весами на 671B параметров, активирующий 37B на токен
Apple Intelligence
2024ИИ на уровне системы, распределяющий работу между устройством и приватным облаком
GPT-4o
2024Универсальная модель с нативной мультимодальностью: текст, изображение и звук через один вход
Command R
2024Коммерческая модель, рассчитанная на дополнение поиском и вызов инструментов
Jamba
2024Модель с открытыми весами, сочетающая модель пространства состояний и Transformer
DBRX
2024Языковая MoE-модель с открытыми весами от Databricks
Mistral Large
2024Флагманская коммерческая модель европейской лаборатории открытых весов
Gemini
2023Универсальная модель с нативной мультимодальностью, рассчитанная на очень длинный контекст
Grok
2023Диалоговая модель, связанная с данными социальной платформы
Yi
2023Двуязычная (китайско-английская) модель с открытыми весами и очень длинным контекстом
Hunyuan
2023Семейство универсальных моделей Tencent с открытыми весами
Qwen
2023Семейство с открытыми весами, охватывающее разные размеры и мультимодальные версии
Phi
2023Небольшие эффективные модели, построенные на отобранных данных
Step
2023Семейство универсальных моделей для мультимодальности и работы на устройстве
Baichuan
2023Универсальная модель с открытыми весами для китайского языка
GLM
2023Китайская универсальная модель, начавшая с авторегрессивного заполнения пропусков
Llama
2023Семейство моделей, сделавшее открытые веса массовым путём
Pangu
2020Семейство базовых моделей Pangu от Huawei
ERNIE
2019Китайская модель, начавшая с обогащённого знаниями предобучения, ранняя заметная версия
Siri
2011Ранний голосовой ассистент, принёсший управление голосом в массовые телефоны
Связанные организации
Типичное применение
- General assistants and support bots
- Coding and study tutoring
- Role-play and companion apps
- Internal knowledge-helpdesk entry points
Как её оценивают
- Human-preference Elo
- Ranking by blind pairwise win rate
- Instruction-following rate
- Share of verifiable constraints (format, length, banned words) satisfied
- Safety violation rate
- Rate of violations under red-team prompts
Границы и трудности
- Constraints from early turns, especially format rules, are forgotten or softened in long chats
- It tends to agree with the user even when the premise is wrong — sycophancy
- Carefully crafted prompts can bypass safety policy; jailbreaks are hard to eliminate
Концепции в основе
Промптинг и выравнивание
Сделать модель полезной, честной и безопасной труднее, чем просто увеличить её
Обучение с подкреплением на основе обратной связи от людей
Когда «хороший ответ» не выразить формулой, роль функции награды берут на себя люди
Архитектура Transformer
Замена эстафеты по одному слову залом, где все говорят сразу, — и дальние зависимости оказываются в одном шаге