CONCEPTS
Все статьи
Сорок восемь ключевых концепций с фильтрацией по области знаний или уровню.
48 статей
Векторы и векторные пространства
ИИ превращает всё — слова, изображения, звуки — в список чисел
Градиент и градиентный спуск
Всё глубокое обучение сводится к одному: сделать маленький шаг вниз по склону
Матричные операции и линейные отображения
Умножение матриц — не груда умножений и сложений, а единовременное преобразование всего пространства
Вероятность и распределения
Модель не выдаёт «ответ», а даёт степень уверенности для каждого возможного ответа
Теорема Байеса
Немного верить, увидеть доказательство, немного поправить — это и есть Байес
Энтропия и теория информации
Чем неожиданнее фраза, тем больше информации она несёт; функция потерь языковой модели измеряет именно эту неожиданность
Обучение с учителем
Пары «вопрос — ответ» учат модель отвечать самостоятельно
Обучение без учителя
Без ответов структура должна проступить из самих данных — и само «хорошо» приходится определять заново
Функции потерь
Функция потерь определяет, что именно вы наказываете, — смените её, и сменится само понятие правильного
Переобучение и регуляризация
Модель заучивает обучающие данные наизусть, а на новых терпит крах
Оценка модели и кросс-валидация
Точность — самый обманчивый показатель: ошибётесь в оценке, и рухнет всё остальное
Компромисс смещения и дисперсии
Каждая ошибка предсказания распадается на три части: слишком простая модель, слишком нестабильная модель и случайность самого мира
Нейрон и перцептрон
Мельчайшая деталь нейросети: взвешенная сумма, смещение и один нелинейный поворот
Обратное распространение
Превращение «вычислить градиент» из математической каторги в один вызов функции — момент, когда глубокое обучение взлетело
Функции активации
Без неё даже самая глубокая сеть — всего лишь одно линейное преобразование
Свёрточные нейронные сети
Замена полных связей на «смотреть локально и переиспользовать один и тот же фильтр везде» — идея, сделавшая распознавание изображений рабочим
Рекуррентные нейронные сети
Дать сети «память»: один и тот же блок переиспользуется во времени для последовательностей любой длины
Нормализация и остаточные связи
Сделать сотню слоёв реально обучаемыми: тождественный «короткий путь» плюс перенормировка на каждом слое
Токенизация
Модель читает не символы, а токены — способ разбиения тихо определяет и возможности, и стоимость
Векторные представления слов
Превращение слов в координаты: синонимы сами собираются вместе, и смыслом впервые можно складывать и вычитать
Механизм внимания
Каждая позиция может напрямую «видеть» все остальные и динамически распределять внимание по релевантности
Архитектура Transformer
Замена эстафеты по одному слову залом, где все говорят сразу, — и дальние зависимости оказываются в одном шаге
Предобучение и дообучение
Сначала выучить язык на огромных неразмеченных корпусах, затем специализироваться на малых данных — самый экономный по данным подход в современном ИИ
Промптинг и выравнивание
Сделать модель полезной, честной и безопасной труднее, чем просто увеличить её
Цифровое представление изображения
Для машины фотография — лишь набор наложенных сеток чисел
Операции свёртки
Маленький шаблон, скользящий по изображению, находит края, текстуры и формы
Классификация изображений
Не говорите «у кошек есть усы» — покажите достаточно кошек, и он поймёт сам
Обнаружение объектов
От «что на изображении» к «что, где и сколько»
Семантическая сегментация
Раскрасить каждый пиксель: не рамка вокруг объекта, а раскраска
Самообучаемое зрение и контрастивное мультимодальное обучение
Без разметки: учиться видеть, определяя, какие изображения совпадают
Марковский процесс принятия решений
«Решать шаг за шагом» записывается пятью символами — отсюда начинается всё обучение с подкреплением
Функции ценности и Q-обучение
Вместо угадывания, что делать, сначала оцените, сколько стоит каждый выбор
Градиенты политики
Настройте саму политику так, чтобы хорошие действия встречались чаще
Исследование и использование
Лучший вариант сейчас не обязательно лучший в долгосрочной перспективе
Глубокое обучение с подкреплением
Пусть нейросеть решает прямо по пикселям — и удерживается давними приёмами
Обучение с подкреплением на основе обратной связи от людей
Когда «хороший ответ» не выразить формулой, роль функции награды берут на себя люди
Обзор порождающих моделей
Дискриминативные модели отвечают «что это», порождающие — «как это должно выглядеть»
Автоэнкодеры и вариационные автоэнкодеры
Сжать информацию через «бутылочное горлышко», а затем восстановить её
Генеративно-состязательные сети
Фальшивомонетчик против эксперта: каждый доводит другого до предела
Диффузионные модели
Научитесь тысяче мелких шагов удаления шума — и соберёте изображение из чистого шума
Диффузия в латентном пространстве и условное управление
Проводить диффузию не по пикселям, а внутри сжатого смыслового пространства
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир
Инфраструктура обучения и вывода
Память определяет размер модели, а коммуникации — время обучения; чистая вычислительная мощность редко бывает узким местом
Сжатие моделей
Сделать модель меньше, быстрее и дешевле почти без потери точности — но три сразу удаётся редко
Оптимизация инференса и обслуживание
Обучение случается один раз, вывод — миллиарды раз в день; быстрый первый токен и высокая пропускная способность обычно тянут в разные стороны
Генерация с дополнением из поиска
Вместо того чтобы втискивать знания в параметры, держать их снаружи и обращаться по мере надобности — как экзамен с открытой книгой
Агенты и использование инструментов
Пусть модель не только отвечает, но и ищет, вызывает API, запускает код — и выбирает следующий шаг по полученному результату
Безопасность, выравнивание и инъекция промптов
Модель оптимизирует прокси в функции потерь, а не то, что мы действительно хотим; зазор между ними и есть вся проблема выравнивания