[{"event_date":{"precision":"day","value":"2026-09-22"},"id":"indexed-opus55-card","linked_record_ids":["opus55-card","cobench"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-opus55"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: Claude Opus 5.5 System Card","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2026-09-03"},"id":"indexed-astra-card","linked_record_ids":["astra-card","openai-research-debugging","kernelgen-1p","nanogpt","posttrainbench-lite","mle-bench"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-astra"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: GPT-6 Astra System Card","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"month","value":"2026-08"},"id":"indexed-gemini37-report","linked_record_ids":["gemini37-report","grb"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-grb"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: Gemini 3.7 Flash Frontier Safety Framework Report","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2025-04-02"},"id":"indexed-paperbench-paper","linked_record_ids":["paperbench-paper","paperbench"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-paperbench"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: PaperBench: Evaluating AI’s Ability to Replicate AI Research","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2024-10-09"},"id":"indexed-mle-paper","linked_record_ids":["mle-paper","mle-bench"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-mle"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2024-11-22"},"id":"indexed-rebench-report","linked_record_ids":["rebench-report","re-bench"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-rebench"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: Evaluating frontier AI R&D capabilities of language model agents against human experts","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2026-01-29"},"id":"indexed-time-horizon-revision","linked_record_ids":["time-horizon-revision","time-horizons"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-th11"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: Time Horizon 1.1","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2025-07-10"},"id":"indexed-productivity-trial","linked_record_ids":["productivity-trial","developer-productivity"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-productivity"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2026-02-24"},"id":"indexed-productivity-redesign","linked_record_ids":["productivity-redesign","developer-productivity"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-productivity-update"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: We are Changing our Developer Productivity Experiment Design","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2025-06-05"},"id":"indexed-reward-hacking","linked_record_ids":["reward-hacking","re-bench"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-hacking"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: Recent Frontier Models Are Reward Hacking","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2026-08-20"},"id":"indexed-ai4ai-paper","linked_record_ids":["ai4ai-paper","ai4ai-bench"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-ai4ai"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2026-09-17"},"id":"indexed-automation-measurements","linked_record_ids":["automation-measurements","anthropic-rd-automation"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-automation"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: Measurements for understanding the pace of AI development inside frontier labs","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2025-05-29"},"id":"indexed-dgm-paper","linked_record_ids":["dgm-paper"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-dgm"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2025-05-14"},"id":"indexed-alphaevolve-report","linked_record_ids":["alphaevolve-report","alphaevolve-training"],"linked_source_refs":[{"locator":"Original publication; linked record contains exact result locators","source_id":"src-alphaevolve"}],"prior_id":null,"replacement_id":null,"summary":"Indexed: AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms","tracker_added_date":{"precision":"day","value":"2026-09-25"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2026-09-10"},"id":"update-autonomy-framework","linked_record_ids":["duan-paper","duan-sep2026"],"linked_source_refs":[{"locator":"Supplied v1, §§3.1–3.7; Figure 9 p.36; §§4.1–4.4","source_id":"src-duan-v1"}],"prior_id":null,"replacement_id":null,"summary":"Added the source-attributed B0–L5 framework and historical domain assessment.","tracker_added_date":{"precision":"day","value":"2026-09-26"},"type":"newly_indexed_historical_evidence"},{"event_date":{"precision":"day","value":"2026-09-26"},"id":"correct-dgm-model-attribution","linked_record_ids":["dgm","dgm-study"],"linked_source_refs":[{"locator":"v1 §4.1 Experiment Setup","source_id":"src-dgm"}],"prior_id":null,"replacement_id":null,"summary":"Corrected DGM model attribution: Claude 3.5 Sonnet (New) handles self-modification and SWE-bench evaluation; o3-mini handles Polyglot evaluation. Reported scores are unchanged.","tracker_added_date":{"precision":"day","value":"2026-09-26"},"type":"corrected_result"}]
