Conversación y seguimiento de instrucciones
Entender la intención en el diálogo y actuar en consecuencia
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ SIGNIFICA ESTA CAPACIDAD
Takes a multi-turn message sequence with roles (system, user, assistant) and outputs the next assistant turn. It is not merely continuation: the model must hold a persona across turns, remember earlier constraints, and obey format and tone instructions. It differs from plain text generation by its explicit role structure and the demand to follow instructions.
Cómo se consigue técnicamente
The base is the same autoregressive language model; the difference lies in chat templates and post-training. System prompts and history are concatenated into a fixed sequence of special tokens, then instruction tuning teaches the model to answer rather than continue a web page. Preference data then shapes it through RLHF or a direct-preference method to favour helpful, harmless and honest behaviour. Tools and memory are injected into the prompt by external systems.
Productos representativos
30ChatGPT
2022La ventana de chat que puso un gran modelo de lenguaje en manos de todos
Claude
2023Un modelo de chat general conocido por su contexto largo y su alineación de seguridad
Gemini
2024Una entrada de chat que reúne búsqueda, ofimática y un modelo multimodal
Kimi
2023Un asistente de chat chino conocido por manejar contextos largos
Doubao
2023El modelo de chat general y la aplicación de ByteDance
Character.AI
2022Chat de rol con personajes que defines y con quienes conversas a largo plazo
Microsoft Copilot
2023IA conversacional integrada en el sistema operativo y las apps de oficina
MiniMax-M
2025Un modelo de razonamiento de pesos abiertos con atención híbrida y contexto de un millón de tokens
o3
2025Razona largamente antes de responder: cambia cómputo en inferencia por más aciertos
DeepSeek-R1
2025Un modelo de razonamiento entrenado con RL sobre cadenas de pensamiento, con pesos abiertos bajo licencia MIT
DeepSeek-V3
2024Un MoE de pesos abiertos con 671B parámetros, activando 37B por token
Apple Intelligence
2024IA a nivel de sistema que reparte el trabajo entre el dispositivo y la nube privada
GPT-4o
2024Un modelo general nativamente multimodal: texto, imagen y audio por una misma puerta
Command R
2024Un modelo comercial diseñado para recuperación aumentada y uso de herramientas
Jamba
2024Un modelo de pesos abiertos que mezcla un modelo de espacio de estados con un Transformer
DBRX
2024Modelo de lenguaje MoE de pesos abiertos de Databricks
Mistral Large
2024El modelo comercial insignia de un laboratorio europeo de pesos abiertos
Gemini
2023Un modelo general nativamente multimodal, pensado para contextos muy largos
Grok
2023Un modelo de chat ligado a los datos de una red social
Yi
2023Un modelo de pesos abiertos bilingüe chino-inglés, con versiones de contexto muy largo
Hunyuan
2023La familia de modelos generales de Tencent, con versiones de pesos abiertos
Qwen
2023Una familia de pesos abiertos con muchos tamaños y versiones multimodales
Phi
2023Modelos pequeños y eficientes construidos con datos seleccionados
Step
2023Una familia de modelos generales orientada a la multimodalidad y el uso en dispositivo
Baichuan
2023Un modelo general de pesos abiertos orientado al uso en chino
GLM
2023Un modelo general chino que comenzó con preentrenamiento de relleno de espacios autorregresivo
Llama
2023La familia que llevó la ruta de pesos abiertos a la corriente principal
Pangu
2020La familia de modelos base Pangu de Huawei
ERNIE
2019Un modelo chino que comenzó con preentrenamiento enriquecido con conocimiento, versión temprana representativa
Siri
2011El primer asistente de voz que llevó el control hablado a los teléfonos
Organizaciones relacionadas
Usos típicos
- General assistants and support bots
- Coding and study tutoring
- Role-play and companion apps
- Internal knowledge-helpdesk entry points
Cómo se evalúa
- Human-preference Elo
- Ranking by blind pairwise win rate
- Instruction-following rate
- Share of verifiable constraints (format, length, banned words) satisfied
- Safety violation rate
- Rate of violations under red-team prompts
Límites y dificultades
- Constraints from early turns, especially format rules, are forgotten or softened in long chats
- It tends to agree with the user even when the premise is wrong — sycophancy
- Carefully crafted prompts can bypass safety policy; jailbreaks are hard to eliminate
Conceptos detrás
Ingeniería de prompts y alineación
Hacer que un modelo sea útil, honesto e inofensivo es más difícil que simplemente agrandarlo
Aprendizaje por refuerzo a partir de retroalimentación humana
Cuando la «buena respuesta» no cabe en una fórmula, deja que las personas actúen como recompensa
Arquitectura Transformer
Sustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto