Перейти к содержимому
Атлас ИИ

Понимание изображений и визуальные вопросы

Смотреть на изображение и отвечать на свободные вопросы

Понимание изображенийНачальный #17
входИзображениеТекстТекст

Полный текст статьи представлен на английском; заголовок и аннотация локализованы.

ЧТО ЭТО ЗА ВОЗМОЖНОСТЬ

Takes an image, optionally with a text question, and outputs a natural-language description or answer — what the person is doing, where the scene might be. Unlike OCR it targets meaning rather than characters, and unlike classification it answers open-ended questions instead of choosing from a fixed label set.

Как это устроено

The mainstream is a multimodal large model: a vision encoder splits the image into patches and encodes them as visual tokens, which are fed with text tokens into one Transformer so the language side produces the answer. Alignment training uses image-caption pairs with contrastive learning, and later instruction tuning teaches question answering. Small text and fine detail are preserved by splitting the image into higher-resolution patches.

Примеры продуктов

9

GPT-4o

2024
OpenAI

Универсальная модель с нативной мультимодальностью: текст, изображение и звук через один вход

Модель Закрытый
ТекстИзображениеАудиоТекстАудио

Gemini

2023
Google DeepMind

Универсальная модель с нативной мультимодальностью, рассчитанная на очень длинный контекст

Модель Закрытый
ТекстИзображениеАудиоВидеоТекст

Claude

2023
Anthropic

Универсальная диалоговая модель, известная длинным контекстом и выравниванием по безопасности

Модель Закрытый
ТекстИзображениеТекст

Qwen

2023
Alibaba (Qwen)

Семейство с открытыми весами, охватывающее разные размеры и мультимодальные версии

Модель Открытые веса
ТекстИзображениеТекст

Doubao

2023
ByteDance (Seed)

Универсальная диалоговая модель и приложение ByteDance

Модель Закрытый
ТекстИзображениеТекст

Kimi

2023
Moonshot AI

Китайский чат-ассистент, известный работой с длинным контекстом

Модель Закрытый
ТекстТекст

GLM

2023
Zhipu AI

Китайская универсальная модель, начавшая с авторегрессивного заполнения пропусков

Модель Закрытый
ТекстТекст

Gemini

2024
Google DeepMind

Единое окно диалога, собравшее поиск, офисные приложения и мультимодальную модель

Приложение Freemium
ТекстИзображениеАудиоТекстИзображениеАудио

ChatGPT

2022
OpenAI

Окно диалога, которое сделало большую языковую модель доступной каждому

Приложение Freemium
ТекстИзображениеАудиоТекстИзображениеАудио

Связанные организации

Типичное применение

  • Accessibility and image narration
  • Product and listing description from photos
  • Assisted reading of industrial and medical images
  • Photo management and content search

Как её оценивают

VQA accuracy
Share answered correctly on annotated question sets
Captioning CIDEr / SPICE
Semantic match between captions and references
Hallucination rate
Share of captions mentioning objects not in the image

Границы и трудности

  • Exact counting and spatial relations are unreliable; miscounting people and flipping left-right are common
  • Small text, chart readings and dense tables in the image are frequently misread
  • The model fills gaps with common sense, describing what should be there as if it were seen

Концепции в основе