Обработка языка и большие языковые модели
От токенизации к трансформерам и говорящим моделям
OVERVIEW
- Все статьи
- 6
- Начальный
- 2
- Средний
- 3
- Экспертный
- 1
Language is cut into tokens, compressed into vectors, and then made to “look at” itself through attention — a loop so plain it seems excessive, yet it lifted next-token prediction all the way to a general assistant. This domain traces that path in order: bag of words, embeddings, RNNs, attention, Transformers, pre-training and alignment.
Вопросы, на которые отвечает эта область
- Q1
What exactly does a model see when it reads a word?
- Q2
Why does attention beat recurrence?
- Q3
Why does next-token prediction yield conversation?
Статьи этой области
- 01ТокенизацияНачальныйМодель читает не символы, а токены — способ разбиения тихо определяет и возможности, и стоимость
- 02Векторные представления словНачальныйПревращение слов в координаты: синонимы сами собираются вместе, и смыслом впервые можно складывать и вычитать
- 03Механизм вниманияСреднийКаждая позиция может напрямую «видеть» все остальные и динамически распределять внимание по релевантности
- 04Архитектура TransformerСреднийЗамена эстафеты по одному слову залом, где все говорят сразу, — и дальние зависимости оказываются в одном шаге
- 05Предобучение и дообучениеСреднийСначала выучить язык на огромных неразмеченных корпусах, затем специализироваться на малых данных — самый экономный по данным подход в современном ИИ
- 06Промптинг и выравниваниеЭкспертныйСделать модель полезной, честной и безопасной труднее, чем просто увеличить её