TAL et grands modèles de langage
De la tokenisation aux Transformers jusqu’aux modèles qui parlent
OVERVIEW
- Tous les concepts
- 6
- Débutant
- 2
- Intermédiaire
- 3
- Expert
- 1
Language is cut into tokens, compressed into vectors, and then made to “look at” itself through attention — a loop so plain it seems excessive, yet it lifted next-token prediction all the way to a general assistant. This domain traces that path in order: bag of words, embeddings, RNNs, attention, Transformers, pre-training and alignment.
Les questions auxquelles ce domaine répond
- Q1
What exactly does a model see when it reads a word?
- Q2
Why does attention beat recurrence?
- Q3
Why does next-token prediction yield conversation?
Entrées de ce domaine
- 01TokenisationDébutantLes modèles ne lisent pas des caractères mais des tokens ; le découpage fixe silencieusement la capacité et le coût
- 02Plongements de motsDébutantTransformer les mots en coordonnées : les synonymes se rapprochent et le sens devient une grandeur que l’on peut additionner
- 03Mécanisme d’attentionIntermédiaireChaque position peut regarder directement toutes les autres et répartir dynamiquement son attention selon la pertinence
- 04Architecture TransformerIntermédiaireRemplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
- 05Pré-entraînement et affinageIntermédiaireApprendre d’abord la langue sur d’immenses corpus non annotés, puis se spécialiser avec peu de données : le paradigme le plus économe en données
- 06Ingénierie des prompts et alignementExpertRendre un modèle utile, honnête et inoffensif est plus difficile que de simplement l’agrandir