Генерация текста
Продолжает текст слово за словом
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО ЗА ВОЗМОЖНОСТЬ
Given a passage as context, the model writes what comes next. Both input and output are text and no particular transformation is targeted: it can continue a story, finish an explanation or draft an email. It differs from conversation in that no instruction format is required, and from summarisation or translation in that neither compression nor a language switch is the goal — both ends stay in the same modality.
Как это устроено
The dominant route is an autoregressive Transformer language model: text is split into tokens, the model predicts the probability of the next token position by position, and training maximises likelihood over the corpus. GPT, Llama and Qwen all follow it, differing in scale, data and post-training recipe. At inference, temperature, top-k and top-p shape diversity, while long outputs reuse cached keys and values to cut cost.
Примеры продуктов
27GPT-4o
2024Универсальная модель с нативной мультимодальностью: текст, изображение и звук через один вход
Llama
2023Семейство моделей, сделавшее открытые веса массовым путём
Qwen
2023Семейство с открытыми весами, охватывающее разные размеры и мультимодальные версии
DeepSeek-V3
2024MoE с открытыми весами на 671B параметров, активирующий 37B на токен
Mistral Large
2024Флагманская коммерческая модель европейской лаборатории открытых весов
Gemini
2023Универсальная модель с нативной мультимодальностью, рассчитанная на очень длинный контекст
Claude
2023Универсальная диалоговая модель, известная длинным контекстом и выравниванием по безопасности
MiniMax-M
2025Модель рассуждений с открытыми весами, гибридным вниманием и контекстом в миллион токенов
DeepSeek-R1
2025Модель рассуждений, обученная RL на цепочках мыслей, с открытыми весами под лицензией MIT
Apple Intelligence
2024ИИ на уровне системы, распределяющий работу между устройством и приватным облаком
Command R
2024Коммерческая модель, рассчитанная на дополнение поиском и вызов инструментов
Jamba
2024Модель с открытыми весами, сочетающая модель пространства состояний и Transformer
DBRX
2024Языковая MoE-модель с открытыми весами от Databricks
Gemini
2024Единое окно диалога, собравшее поиск, офисные приложения и мультимодальную модель
Grok
2023Диалоговая модель, связанная с данными социальной платформы
Yi
2023Двуязычная (китайско-английская) модель с открытыми весами и очень длинным контекстом
Kimi
2023Китайский чат-ассистент, известный работой с длинным контекстом
Hunyuan
2023Семейство универсальных моделей Tencent с открытыми весами
Microsoft Copilot
2023Разговорный ИИ, встроенный в операционную систему и офисные приложения
Doubao
2023Универсальная диалоговая модель и приложение ByteDance
Phi
2023Небольшие эффективные модели, построенные на отобранных данных
Step
2023Семейство универсальных моделей для мультимодальности и работы на устройстве
Baichuan
2023Универсальная модель с открытыми весами для китайского языка
GLM
2023Китайская универсальная модель, начавшая с авторегрессивного заполнения пропусков
ChatGPT
2022Окно диалога, которое сделало большую языковую модель доступной каждому
Character.AI
2022Ролевой чат с персонажами, которых вы задаёте и с которыми говорите долго
ERNIE
2019Китайская модель, начавшая с обогащённого знаниями предобучения, ранняя заметная версия
Связанные организации
Типичное применение
- First drafts and rewriting
- Drafting email, documents and copy
- Code comments and API docs
- Test data and synthetic corpora
Как её оценивают
- Perplexity
- Predictive uncertainty on held-out text; lower is better
- Human-preference Elo
- Preference ranking from pairwise comparison
- ROUGE/BLEU on constrained tasks
- Reference overlap when an answer key exists
Границы и трудности
- Fluency is not truth: the model states wrong facts with confidence — hallucination
- Over long outputs, earlier setup drifts and the text contradicts itself
- Poor sampling settings can trap the model in repetitive or degenerate loops
Концепции в основе
Архитектура Transformer
Замена эстафеты по одному слову залом, где все говорят сразу, — и дальние зависимости оказываются в одном шаге
Предобучение и дообучение
Сначала выучить язык на огромных неразмеченных корпусах, затем специализироваться на малых данных — самый экономный по данным подход в современном ИИ
Промптинг и выравнивание
Сделать модель полезной, честной и безопасной труднее, чем просто увеличить её