Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
Veo is a text-to-video model Google DeepMind announced in May 2024. It accepts text or image input, generates 1080p video longer than a minute, and supports several cinematic styles and camera controls. Veo is also used in product settings such as YouTube’s short-form tools. Its weights are not open.
Почему стоит запомнить
It put high resolution, longer duration and controllable camera work into a single video model and fed it directly into Google’s product line, making it a major entry in the 2024 text-to-video race.
Ключевые характеристики
- Resolution
- 1080p
- Duration
- Over 60 seconds (first disclosure)
- Input
- Text, image
- Open weights
- No
Возможности
Связанные концепции
Диффузионные модели
Научитесь тысяче мелких шагов удаления шума — и соберёте изображение из чистого шума
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир
Инфраструктура обучения и вывода
Память определяет размер модели, а коммуникации — время обучения; чистая вычислительная мощность редко бывает узким местом
Аналоги
Sora
2024Создаёт связное видео длиной около минуты по текстовому описанию
Gen-3 Alpha
2024Хорошо управляемая модель текст-видео для кино и рекламы
Kling
2024Модель коротких видео как из текста, так и из изображения
Dream Machine
2024Создаёт короткие видео с движением из текста или изображения
Seedance
2024Модель генерации видео для многоракурсного повествования
Synthesia
2019Введите текст — получите видео с говорящим цифровым аватаром