Episode Details
Back to EpisodesTrust Region Policy Distillation (TOP-D)
Published 2 months, 3 weeks ago
Description
Transforms unstable on-policy distillation into a stable training paradigm via dynamic proximal teacher construction, improving sample efficiency without additional computational overhead.