Benchmark2024-10-09MLE-benchBenchmark by OpenAIOriginal paper v1 (2024)3.0 ± 1.0%Llama 3.1 405B / AIDEMLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering (v1)↗