benchmark

AI4AI-Bench

Rewrite training algorithms in frozen research repositories.

AI-system improvement

What this measure tells us

Tests algorithm-design ability relevant to AI improving AI.

  • System means average different effort grids.
  • No multi-generation optimizer improvement is demonstrated by these task scores.

Results by version

Paper v1

2026-08-20 · 10 tasks

Ten algorithm families; fixed hidden evaluator retrains submissions.

AI4AI-Bench · Mean normalized score

limited comparison

Different effort grids and costs; no automatic delta.

AI4AI-Bench: Mean normalized scoreCategorical point plot with no connecting line. Source explicitly reports these systems under the same evaluation design.0.10.20.3normalized_scoreBaseline reference · 0.12026-08-20: 0.174 normalized_score · Kimi K3 / Claude Code effort aggregate10.1742026-08-20: 0.117 normalized_score · GPT-5.6 Luna / Codex effort aggregate20.1172026-08-20: 0.25 normalized_score · Claude Opus 5 / Claude Code effort aggregate30.252026-08-20: 0.191 normalized_score · GPT-5.6 Sol / Codex effort aggregate40.1912026-08-20: 0.145 normalized_score · Claude Sonnet 5 / Claude Code effort aggregate50.1452026-08-20: 0.135 normalized_score · GPT-5.6 Terra / Codex effort aggregate60.135
Published results · Paper v1
KeySystem / organizationMetricReported resultDateProtocolVerificationEvidence
3Claude Opus 5 / Claude Code effort aggregateMean normalized score0.250 normalized_score2026-08-20a4-opus-pbenchmark author reported
4GPT-5.6 Sol / Codex effort aggregateMean normalized score0.191 normalized_score2026-08-20a4-sol-pbenchmark author reported
1Kimi K3 / Claude Code effort aggregateMean normalized score0.174 normalized_score2026-08-20a4-kimi-pbenchmark author reported
5Claude Sonnet 5 / Claude Code effort aggregateMean normalized score0.145 normalized_score2026-08-20a4-sonnet-pbenchmark author reported
6GPT-5.6 Terra / Codex effort aggregateMean normalized score0.135 normalized_score2026-08-20a4-terra-pbenchmark author reported
2GPT-5.6 Luna / Codex effort aggregateMean normalized score0.117 normalized_score2026-08-20a4-luna-pbenchmark author reported

Version lineage

Reference points

Availability

What is publicly available
ResourceStatus
public descriptionyes
public resultsyes
public tasksyes
public codeyes
public evaluation serviceunknown

Official sources