Episode Details
Back to EpisodesUniVR-34B: A Vision-Only Foundation Model for Physical Tasks
Published 2 months, 3 weeks ago
Description
First large-scale model to learn complex physical dynamics, visual reasoning, and long-horizon planning directly from visual demonstrations without text chains; released with 310k SFT and 3k RL samples across 16 sources alongside the VR-X benchmark.