Episode Details
Back to EpisodesXiaomi-Robotics-1: A Scalable Vision-Language-Action Foundation Model for Mobile Manipulation
Published 2 months, 2 weeks ago
Description
A scalable vision-language-action (VLA) foundation model pretrained on over 100k hours of real-world manipulation trajectories, enabling out-of-the-box mobile manipulation capabilities.