Generación de texto
Continúa un texto palabra por palabra
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ SIGNIFICA ESTA CAPACIDAD
Given a passage as context, the model writes what comes next. Both input and output are text and no particular transformation is targeted: it can continue a story, finish an explanation or draft an email. It differs from conversation in that no instruction format is required, and from summarisation or translation in that neither compression nor a language switch is the goal — both ends stay in the same modality.
Cómo se consigue técnicamente
The dominant route is an autoregressive Transformer language model: text is split into tokens, the model predicts the probability of the next token position by position, and training maximises likelihood over the corpus. GPT, Llama and Qwen all follow it, differing in scale, data and post-training recipe. At inference, temperature, top-k and top-p shape diversity, while long outputs reuse cached keys and values to cut cost.
Productos representativos
27GPT-4o
2024Un modelo general nativamente multimodal: texto, imagen y audio por una misma puerta
Llama
2023La familia que llevó la ruta de pesos abiertos a la corriente principal
Qwen
2023Una familia de pesos abiertos con muchos tamaños y versiones multimodales
DeepSeek-V3
2024Un MoE de pesos abiertos con 671B parámetros, activando 37B por token
Mistral Large
2024El modelo comercial insignia de un laboratorio europeo de pesos abiertos
Gemini
2023Un modelo general nativamente multimodal, pensado para contextos muy largos
Claude
2023Un modelo de chat general conocido por su contexto largo y su alineación de seguridad
MiniMax-M
2025Un modelo de razonamiento de pesos abiertos con atención híbrida y contexto de un millón de tokens
DeepSeek-R1
2025Un modelo de razonamiento entrenado con RL sobre cadenas de pensamiento, con pesos abiertos bajo licencia MIT
Apple Intelligence
2024IA a nivel de sistema que reparte el trabajo entre el dispositivo y la nube privada
Command R
2024Un modelo comercial diseñado para recuperación aumentada y uso de herramientas
Jamba
2024Un modelo de pesos abiertos que mezcla un modelo de espacio de estados con un Transformer
DBRX
2024Modelo de lenguaje MoE de pesos abiertos de Databricks
Gemini
2024Una entrada de chat que reúne búsqueda, ofimática y un modelo multimodal
Grok
2023Un modelo de chat ligado a los datos de una red social
Yi
2023Un modelo de pesos abiertos bilingüe chino-inglés, con versiones de contexto muy largo
Kimi
2023Un asistente de chat chino conocido por manejar contextos largos
Hunyuan
2023La familia de modelos generales de Tencent, con versiones de pesos abiertos
Microsoft Copilot
2023IA conversacional integrada en el sistema operativo y las apps de oficina
Doubao
2023El modelo de chat general y la aplicación de ByteDance
Phi
2023Modelos pequeños y eficientes construidos con datos seleccionados
Step
2023Una familia de modelos generales orientada a la multimodalidad y el uso en dispositivo
Baichuan
2023Un modelo general de pesos abiertos orientado al uso en chino
GLM
2023Un modelo general chino que comenzó con preentrenamiento de relleno de espacios autorregresivo
ChatGPT
2022La ventana de chat que puso un gran modelo de lenguaje en manos de todos
Character.AI
2022Chat de rol con personajes que defines y con quienes conversas a largo plazo
ERNIE
2019Un modelo chino que comenzó con preentrenamiento enriquecido con conocimiento, versión temprana representativa
Organizaciones relacionadas
Usos típicos
- First drafts and rewriting
- Drafting email, documents and copy
- Code comments and API docs
- Test data and synthetic corpora
Cómo se evalúa
- Perplexity
- Predictive uncertainty on held-out text; lower is better
- Human-preference Elo
- Preference ranking from pairwise comparison
- ROUGE/BLEU on constrained tasks
- Reference overlap when an answer key exists
Límites y dificultades
- Fluency is not truth: the model states wrong facts with confidence — hallucination
- Over long outputs, earlier setup drifts and the text contradicts itself
- Poor sampling settings can trap the model in repetitive or degenerate loops
Conceptos detrás
Arquitectura Transformer
Sustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto
Preentrenamiento y ajuste fino
Aprender el lenguaje primero con texto sin etiquetas y luego especializarse con pocos datos: el paradigma más eficiente en datos de la IA moderna
Ingeniería de prompts y alineación
Hacer que un modelo sea útil, honesto e inofensivo es más difícil que simplemente agrandarlo