Episode Details
Back to EpisodesFlashAttention-3: Fast & Accurate Attention with Asynchrony & Low-Precision
Published 6 months, 1 week ago
Description
Major efficiency leap for Transformer attention mechanisms, enabling faster training/inference on long sequences with low-precision compute.