Conversa e seguimento de instruções
Entender a intenção ao longo do diálogo e agir
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE ESTA CAPACIDADE SIGNIFICA
Takes a multi-turn message sequence with roles (system, user, assistant) and outputs the next assistant turn. It is not merely continuation: the model must hold a persona across turns, remember earlier constraints, and obey format and tone instructions. It differs from plain text generation by its explicit role structure and the demand to follow instructions.
Como é feita tecnicamente
The base is the same autoregressive language model; the difference lies in chat templates and post-training. System prompts and history are concatenated into a fixed sequence of special tokens, then instruction tuning teaches the model to answer rather than continue a web page. Preference data then shapes it through RLHF or a direct-preference method to favour helpful, harmless and honest behaviour. Tools and memory are injected into the prompt by external systems.
Produtos representativos
30ChatGPT
2022A janela de chat que colocou um grande modelo de linguagem nas mãos de todos
Claude
2023Um modelo de conversa geral conhecido por contexto longo e alinhamento de segurança
Gemini
2024Uma entrada de chat que reúne busca, escritório e um modelo multimodal
Kimi
2023Um assistente de conversa chinês conhecido por lidar com contextos longos
Doubao
2023O modelo de conversa geral e o aplicativo da ByteDance
Character.AI
2022Chat de interpretação com personagens que você define e com quem conversa por muito tempo
Microsoft Copilot
2023IA conversacional integrada ao sistema operacional e aos apps de escritório
MiniMax-M
2025Um modelo de raciocínio de pesos abertos com atenção híbrida e contexto de um milhão de tokens
o3
2025Raciocina longamente antes de responder, trocando computação na inferência por mais acerto
DeepSeek-R1
2025Um modelo de raciocínio treinado com RL sobre cadeias de pensamento, com pesos abertos sob licença MIT
DeepSeek-V3
2024Um MoE de pesos abertos com 671B parâmetros, ativando 37B por token
Apple Intelligence
2024IA em nível de sistema que divide o trabalho entre o dispositivo e a nuvem privada
GPT-4o
2024Um modelo geral nativamente multimodal: texto, imagem e áudio por uma única porta
Command R
2024Um modelo comercial feito para recuperação aumentada e uso de ferramentas
Jamba
2024Um modelo de pesos abertos que mistura um modelo de espaço de estados com um Transformer
DBRX
2024Modelo de linguagem MoE de pesos abertos da Databricks
Mistral Large
2024O modelo comercial principal de um laboratório europeu de pesos abertos
Gemini
2023Um modelo geral nativamente multimodal, feito para contextos muito longos
Grok
2023Um modelo de conversa ligado aos dados de uma rede social
Yi
2023Um modelo de pesos abertos bilíngue chinês-inglês, com versões de contexto muito longo
Hunyuan
2023A família de modelos gerais da Tencent, com versões de pesos abertos
Qwen
2023Uma família de pesos abertos com muitos tamanhos e versões multimodais
Phi
2023Modelos pequenos e eficientes, construídos com dados selecionados
Step
2023Uma família de modelos gerais voltada à multimodalidade e ao uso no dispositivo
Baichuan
2023Um modelo geral de pesos abertos voltado ao uso em chinês
GLM
2023Um modelo geral chinês que começou com pré-treinamento de preenchimento de lacunas autorregressivo
Llama
2023A família que tornou a rota de pesos abertos mainstream
Pangu
2020A família de modelos base Pangu da Huawei
ERNIE
2019Um modelo chinês que começou com pré-treinamento enriquecido por conhecimento, versão inicial representativa
Siri
2011O assistente de voz inicial que levou o controle por voz aos celulares populares
Organizações relacionadas
Usos típicos
- General assistants and support bots
- Coding and study tutoring
- Role-play and companion apps
- Internal knowledge-helpdesk entry points
Como avaliar se funciona bem
- Human-preference Elo
- Ranking by blind pairwise win rate
- Instruction-following rate
- Share of verifiable constraints (format, length, banned words) satisfied
- Safety violation rate
- Rate of violations under red-team prompts
Limites e dificuldades
- Constraints from early turns, especially format rules, are forgotten or softened in long chats
- It tends to agree with the user even when the premise is wrong — sycophancy
- Carefully crafted prompts can bypass safety policy; jailbreaks are hard to eliminate
Conceitos por trás
Engenharia de prompts e alinhamento
Tornar um modelo útil, honesto e inofensivo é mais difícil do que apenas torná-lo maior
Aprendizado por reforço a partir de feedback humano
Quando a «boa resposta» não cabe numa fórmula, deixe as pessoas servirem de recompensa
Arquitetura Transformer
Substituir o revezamento palavra a palavra por uma sala onde todos falam ao mesmo tempo, deixando dependências distantes a um salto