Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NÓ LÀ GÌ
Veo is a text-to-video model Google DeepMind announced in May 2024. It accepts text or image input, generates 1080p video longer than a minute, and supports several cinematic styles and camera controls. Veo is also used in product settings such as YouTube’s short-form tools. Its weights are not open.
Vì sao đáng ghi nhớ
It put high resolution, longer duration and controllable camera work into a single video model and fed it directly into Google’s product line, making it a major entry in the 2024 text-to-video race.
Thông số chính
- Resolution
- 1080p
- Duration
- Over 60 seconds (first disclosure)
- Input
- Text, image
- Open weights
- No
Năng lực liên quan
Khái niệm liên quan
Mô hình khuếch tán
Học ngàn bước khử nhiễu nhỏ, bạn tạo được ảnh từ nhiễu thuần
Sinh đa phương thức
Một mô hình học nói, vẽ, chuyển động — thậm chí mô hình hóa thế giới ba chiều
Hạ tầng huấn luyện và suy luận
Bộ nhớ quyết định mô hình lớn đến đâu, còn truyền thông quyết định mất bao lâu
Sản phẩm cùng loại
Sora
2024Tạo video mạch lạc dài tới khoảng một phút từ một mô tả
Gen-3 Alpha
2024Mô hình văn bản thành video dễ điều khiển cho phim và quảng cáo
Kling
2024Mô hình video ngắn cho cả văn bản thành video và ảnh thành video
Dream Machine
2024Tạo video ngắn có chuyển động từ văn bản hoặc ảnh
Seedance
2024Mô hình tạo video hướng tới kể chuyện nhiều cảnh
Synthesia
2019Nhập văn bản, nhận video có nhân vật ảo đang nói