Automated AI Research on MLE-Bench official (full)
98.7Valid Submission RateMARS
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| MARSModel=Gemini-3-Pro-Preview, Evaluation Environment=Controlled Evaluation in Our Environment2026.02 | 98.7 | 65.8 | 9.3 | 15.6 | 31.1 | 56 | |
| MARS+Model=Gemini-3-Pro-Preview, Evaluation Environment=Controlled Evaluation in Our Environment2026.02 | 98.7 | 73.3 | 10.2 | 18.7 | 30.7 | 59.6 | |
| AIRA-dojoModel=Gemini-3-Pro-Preview, Evaluation Environment=Controlled Evaluation in Our Environment2026.02 | 98.2 | 55.6 | 5.8 | 8 | 24 | 37.8 | |
| Famou-AgentModel=Gemini-2.5-Pro, Evaluation Environment=Official MLE-Bench Leaderboard2026.02 | 96.9 | 51.6 | 8.4 | 12.4 | 22.7 | 43.6 | |
| InternAgentModel=Deepseek-R1, Evaluation Environment=Official MLE-Bench Leaderboard2026.02 | 96.4 | 48.4 | 7.1 | 10.7 | 18.7 | 36.4 | |
| ML-Master 2.0Model=Deepseek-V3.2-Speciale, Evaluation Environment=Official MLE-Bench Leaderboard2026.02 | 95.6 | 63.1 | 11.1 | 25.8 | 19.6 | 56.4 | |
| MARSModel=Gemini-2.5-Pro, Evaluation Environment=Controlled Evaluation in Our Environment2026.02 | 94.2 | 52.4 | 11.6 | 12.4 | 19.1 | 43.1 | |
| ML-MasterModel=Deepseek-R1, Evaluation Environment=Official MLE-Bench Leaderboard2026.02 | 93.3 | 44.9 | 4.4 | 7.6 | 17.3 | 29.3 | |
| AIDEModel=Gemini-2.5-Pro, Evaluation Environment=Controlled Evaluation in Our Environment2026.02 | 84.4 | 40 | 5.8 | 4.9 | 12.4 | 23.1 | |
| AIRA-dojoModel=Gemini-2.5-Pro, Evaluation Environment=Controlled Evaluation in Our Environment2026.02 | 83.6 | 38.7 | 2.7 | 6.7 | 15.1 | 24.4 | |
| AIDEModel=Gemini-3-Pro-Preview, Evaluation Environment=Controlled Evaluation in Our Environment2026.02 | 82.7 | 48 | 4.9 | 11.1 | 16.4 | 32.4 | |
| R&D-AgentModel=GPT-5, Evaluation Environment=Official MLE-Bench Leaderboard2026.02 | 53.3 | 40.4 | 6.7 | 12 | 16.4 | 35.1 | |
| LeerooModel=Gemini-3-Pro-Preview, Evaluation Environment=Official MLE-Bench Leaderboard2026.02 | 50.7 | 50.7 | 14.2 | 15.1 | 21.3 | 50.7 |