PLN y grandes modelos de lenguaje
De la tokenización a los Transformers y a modelos que conversan
OVERVIEW
- Todos los conceptos
- 6
- Principiante
- 2
- Intermedio
- 3
- Experto
- 1
Language is cut into tokens, compressed into vectors, and then made to “look at” itself through attention — a loop so plain it seems excessive, yet it lifted next-token prediction all the way to a general assistant. This domain traces that path in order: bag of words, embeddings, RNNs, attention, Transformers, pre-training and alignment.
Preguntas que responde este dominio
- Q1
What exactly does a model see when it reads a word?
- Q2
Why does attention beat recurrence?
- Q3
Why does next-token prediction yield conversation?
Entradas de este dominio
- 01TokenizaciónPrincipianteLos modelos no leen caracteres, leen tokens; y cómo los dividas decide en silencio capacidad y coste
- 02Embeddings de palabrasPrincipianteConvertir palabras en coordenadas: los sinónimos se agrupan solos y el significado pasa a ser algo que se puede sumar y restar
- 03Mecanismo de atenciónIntermedioCada posición puede mirar directamente a todas las demás y repartir su atención según la relevancia
- 04Arquitectura TransformerIntermedioSustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto
- 05Preentrenamiento y ajuste finoIntermedioAprender el lenguaje primero con texto sin etiquetas y luego especializarse con pocos datos: el paradigma más eficiente en datos de la IA moderna
- 06Ingeniería de prompts y alineaciónExpertoHacer que un modelo sea útil, honesto e inofensivo es más difícil que simplemente agrandarlo