preprint · 2026-08-20
AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na
Why it matters here
Frozen repositories and hidden retraining evaluators test algorithm design. Many attempts fail to outperform the original recipe.
AI-system improvement
What to keep in mind
- Effort aggregates differ; one-step algorithm design is not a demonstrated recursive loop.