PLN e grandes modelos de linguagem
Da tokenização aos Transformers e a modelos que conversam
OVERVIEW
- Todos os conceitos
- 6
- Iniciante
- 2
- Intermediário
- 3
- Especialista
- 1
Language is cut into tokens, compressed into vectors, and then made to “look at” itself through attention — a loop so plain it seems excessive, yet it lifted next-token prediction all the way to a general assistant. This domain traces that path in order: bag of words, embeddings, RNNs, attention, Transformers, pre-training and alignment.
Perguntas que este domínio responde
- Q1
What exactly does a model see when it reads a word?
- Q2
Why does attention beat recurrence?
- Q3
Why does next-token prediction yield conversation?
Entradas deste domínio
- 01TokenizaçãoInicianteOs modelos não leem caracteres, leem tokens; e como você divide define silenciosamente a capacidade e o custo
- 02Embeddings de palavrasInicianteTransformar palavras em coordenadas: sinônimos se agrupam sozinhos e o significado passa a poder ser somado e subtraído
- 03Mecanismo de atençãoIntermediárioCada posição pode olhar diretamente para todas as outras e distribuir atenção conforme a relevância
- 04Arquitetura TransformerIntermediárioSubstituir o revezamento palavra a palavra por uma sala onde todos falam ao mesmo tempo, deixando dependências distantes a um salto
- 05Pré-treinamento e ajuste finoIntermediárioAprender a língua primeiro com texto não rotulado e depois especializar com poucos dados: o paradigma mais eficiente em dados da IA moderna
- 06Engenharia de prompts e alinhamentoEspecialistaTornar um modelo útil, honesto e inofensivo é mais difícil do que apenas torná-lo maior