Episode Details
Back to EpisodesEmbodiedOneVision: Interleaved Vision-Text-Action Pretraining for General Robot Control
Published 3 months, 3 weeks ago
Description
Open-source 3B unified embodied foundation model trained on 1.5M interleaved vision-text-action samples for perception, planning, and acting.