Episode Details

Back to Episodes

Generative Depth Supervision for Embodied Vision-Language Models

Published 4 months ago
Description
Vision-language model that adds generative depth prediction during pre-training for physical grounding; achieves SOTA on embodied benchiments and transfers directly to real-robot tasks.
Listen Now

Love PodBriefly?

If you like Podbriefly.com, please consider donating to support the ongoing development.

Support Us