Figure 02
Человекоподобный робот второго поколения под управлением модели «зрение–язык–действие»
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
Figure 02 is the second-generation humanoid robot Figure AI released in August 2024, designed for settings such as industry. It pairs a vision-language-action model with robot hardware so the robot can understand spoken instructions and carry out grasping and carrying tasks. Figure worked with OpenAI and demonstrated talking to the robot by voice and giving it tasks.
Почему стоит запомнить
By connecting a vision-language-action model and a conversational speech model to a physical robot, it offers a direct demonstration of models entering the physical world.
Ключевые характеристики
- Form
- Bipedal humanoid robot, battery-powered
- Perception
- Camera vision
- Control
- Vision-language-action model
Связанные концепции
Глубокое обучение с подкреплением
Пусть нейросеть решает прямо по пикселям — и удерживается давними приёмами
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир
Обнаружение объектов
От «что на изображении» к «что, где и сколько»
Безопасность, выравнивание и инъекция промптов
Модель оптимизирует прокси в функции потерь, а не то, что мы действительно хотим; зазор между ними и есть вся проблема выравнивания