Podcast Episodes
Back to SearchACES: Who Tests the Tests? Leave-One-Out AUC Consistency for Code Generation
Episode 1741
🤗 Upvotes: 47 | cs.LG
Authors:
Hui Sun, Yun-Ji Zhang, Zheng Xie, Ren-Biao Liu, Yali Du, Xin-Ye Li, Ming Li
4Â months, 2Â weeks ago
GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers
Episode 1740
🤗 Upvotes: 37 | cs.SE, cs.AI
Authors:
Shufan Jiang, Chios Chen, Zhiyang Chen
Title:
GBQA…
4Â months, 2Â weeks ago
Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
Episode 1739
🤗 Upvotes: 33 | cs.PF, cs.SE
Authors:
Qisheng Su, Shiting Huang, Zhen Fang, Ziyan Chen, Zehui Chen, Feng Zhao
4Â months, 2Â weeks ago
ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement
Episode 1738
🤗 Upvotes: 32 | cs.AI
Authors:
Difan Jiao, Qianfeng Wen, Blair Yang, Zhenwei Tang, Ashton Anderson
T…
4Â months, 2Â weeks ago
Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision
Episode 1737
🤗 Upvotes: 31 | cs.CV
Authors:
Hyunsoo Cha, Wonjung Woo, Byungjun Kim, Hanbyul Joo
Title:
…
4Â months, 2Â weeks ago
MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU
Episode 1736
🤗 Upvotes: 26 | cs.CL, cs.DC, cs.OS
Authors:
Zhengqing Yuan, Hanchi Sun, Lichao Sun, Yanfang Ye
Titl…
4Â months, 2Â weeks ago
Watch Before You Answer: Learning from Visually Grounded Post-Training
Episode 1735
🤗 Upvotes: 26 | cs.CV, cs.AI, cs.CL
Authors:
Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Ji…
4Â months, 2Â weeks ago
OpenWorldLib: A Unified Codebase and Definition of Advanced World Models
Episode 1734
🤗 Upvotes: 152 | cs.CV
Authors:
DataFlow Team, Bohan Zeng, Daili Hua, Kaixin Zhu, Yifan Dai, Bozhou Li, Yuran Wa…
4Â months, 2Â weeks ago
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
Episode 1733
🤗 Upvotes: 91 | cs.CV, cs.CL
Authors:
Bin Wang, Tianyao He, Linke Ouyang, Fan Wu, Zhiyuan Zhao, Tao Chu, Yuan Qu…
4Â months, 2Â weeks ago
LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models
Episode 1732
🤗 Upvotes: 72 | cs.LG
Authors:
Chanyoung Kim, Minwoo Kim, Minseok Kang, Hyunwoo Kim, Dahuin Jung
Tit…
4Â months, 2Â weeks ago