RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 5 days ago • 256
SimuVerity: Benchmarking Agents for Engineering-Grade Simulink Model Generation Paper • 2610.02304 • Published 5 days ago • 46
HyperBrowseComp: A Multilingual and Multimodal Stress Test for Web-Browsing Agents Paper • 2610.03574 • Published 4 days ago • 51
Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers Paper • 2610.00531 • Published 6 days ago • 50
Scaling Properties of Same-Family On-Policy Distillation Paper • 2609.32722 • Published 10 days ago • 322
EmoRES-TTS: Residual-Enhanced Vector Steering for Emotional Speech Generation Paper • 2609.38157 • Published 7 days ago • 20
HiRAE: Hierarchical Representation Autoencoding with Residual Budgets Paper • 2609.37775 • Published 7 days ago • 25
EVO-WAM: Evolving World Action Models through Video-Action Verification Paper • 2609.38057 • Published 7 days ago • 48