Перейти к содержимому
Атлас ИИ

CAPABILITIES

Что умеет ИИ

Сорок возможностей, объединённых в девять семейств по предмету обработки. Для каждой объясняется, что она означает, как устроена технически, где применяется и какие продукты её уже реализуют.

Матрица модальностейПо горизонтали — выход, по вертикали — вход; в ячейках — число возможностей для этой пары.
ТекстИзображениеВидеоАудио3DТаблицаКодДействиевход ↓Текст102231323Изображение35114Видео11Аудио111Таблица1Код1

Нажмите на любую ячейку, чтобы увидеть возможности для пары «вход → выход».

Язык и знания

10 возможностей

От написания первого слова до понимания целого документа: это семейство работает с самими последовательностями символов — порождает, переписывает, переводит, резюмирует, извлекает, ищет и рассуждает.

Начальный

Генерация текста

Продолжает текст слово за словом

ТекстТекст
Начальный

Диалог и следование инструкциям

Понимать намерение по ходу диалога и выполнять его

ТекстТекст
Начальный

Машинный перевод

Передать текст с одного языка на другой

ТекстТекст
Начальный

Суммаризация текста

Сжать длинный текст в более короткий и точный

ТекстТекст
Начальный

Классификация текста и анализ тональности

Присвоить тексту заранее заданную метку

ТекстТекст
Средний

Извлечение информации и распознавание сущностей

Извлечь имена, места и связи из свободного текста

ТекстТекст
Начальный

Вопросы и ответы с поиском

Сначала находит свидетельства, затем отвечает по ним

ТекстТекст
Средний

Рассуждение и цепочка мыслей

Разбить трудную задачу на промежуточные шаги

ТекстТекст
Средний

Текстовые эмбеддинги и семантический поиск

Превратить фразы в векторы и найти ближайшие по смыслу

ТекстТаблица
Средний

Переранжирование результатов

Переупорядочить кандидатов по истинной релевантности

ТекстТаблица

Понимание изображений

7 возможностей

Научить модель понимать изображение. От простейшей классификации до выделения объектов рамками, попиксельной сегментации, распознавания текста и лиц, а затем и ответов на вопросы об изображении.

Генерация и редактирование изображений

5 возможностей

От описания или наброска — сразу к изображению: его созданию, правке и восстановлению. Это семейство генеративного ИИ, которое широкая публика заметила первым.

Видео

4 возможностей

Видео — это движущееся изображение плюс время. Здесь приходится работать и с пространством, и со временем: генерировать короткие ролики, понимать действия, монтировать кадры и синхронизировать губы.

Речь и музыка

4 возможностей

Звук — это и волна, и временной ряд. Распознавание речи переводит его в текст, синтез речи — обратно; генерация музыки и звуковых эффектов даёт готовый к прослушиванию материал.

3D

2 возможностей

Перевод двумерных данных в трёхмерные активы: сетки, облака точек и сцены, пригодные для рендеринга. Это основа для игр, кино и симуляции роботов.

Код и ПО

2 возможностей

Код — язык со строгой грамматикой. Это семейство не просто дописывает следующую строку, но и понимает весь репозиторий, запускает команды, ищет и исправляет ошибки.

Агенты и работа с инструментами

3 возможностей

Когда модель умеет вызывать инструменты, читать и писать файлы и управлять браузером, она переходит от ответов на вопросы к выполнению задач. Здесь важно выстраивать действия в надёжные цепочки.

Данные и документы

3 возможностей

Превращение беспорядочных таблиц, документов и вёрстки в структурированные поля. Это первый барьер, который приходится преодолеть, встраивая ИИ в реальный рабочий процесс.