Figure 02
Ein humanoider Roboter der zweiten Generation, gesteuert von einem Vision-Sprache-Aktion-Modell
Der vollständige Artikel liegt auf Englisch vor; Titel und Zusammenfassung sind lokalisiert.
WAS ES IST
Figure 02 is the second-generation humanoid robot Figure AI released in August 2024, designed for settings such as industry. It pairs a vision-language-action model with robot hardware so the robot can understand spoken instructions and carry out grasping and carrying tasks. Figure worked with OpenAI and demonstrated talking to the robot by voice and giving it tasks.
Warum es wichtig ist
By connecting a vision-language-action model and a conversational speech model to a physical robot, it offers a direct demonstration of models entering the physical world.
Wichtige Eckdaten
- Form
- Bipedal humanoid robot, battery-powered
- Perception
- Camera vision
- Control
- Vision-language-action model
Verwandte Konzepte
Deep Reinforcement Learning
Lass ein neuronales Netz direkt aus Pixeln entscheiden – und halte es mit alten Kniffen stabil
Multimodale Generierung
Ein Modell, das sprechen, zeichnen, sich bewegen — und sogar die 3D-Welt modellieren lernt
Objekterkennung
Von „was ist im Bild“ zu „was, wo und wie viele“
Sicherheit, Alignment und Prompt-Injection
Ein Modell optimiert den Proxy in der Verlustfunktion, nie das eigentlich Gewollte – die Lücke dazwischen ist das ganze Alignment-Problem