Scientific Agent Task Completion on ScienceAgentBench
43.1Success Rate (SR)Mimosa
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MimosaMode=Iterative Learning, Model=DeepSeek-V3.22026.03 | 43.1 | 92.1 | 1.7 | |
| MimosaMode=Single Agent (SmolAgent), Model=DeepSeek-V3.22026.03 | 38.2 | 89.8 | 0.05 | |
| MimosaMode=Multi-Agent One-shot, Model=DeepSeek-V3.22026.03 | 32.4 | 79.4 | 0.38 | |
| MimosaMode=Multi-Agent One-shot, Model=Claude Haiku 4.52026.03 | 31.3 | 77.3 | 2.2 | |
| MimosaMode=Iterative Learning, Model=Claude Haiku 4.52026.03 | 30.3 | 88.5 | 7.8 | |
| DataPRMParams=4B, N=82026.04 | 25.64 | — | — | |
| DataPRMParams=4B, N=162026.04 | 25.64 | — | — | |
| Majority VoteParams=-, N=42026.04 | 24.36 | — | — | |
| Majority VoteParams=-, N=82026.04 | 24.36 | — | — | |
| LLM-as-a-judgeParams=-, N=42026.04 | 24.36 | — | — | |
| LLM-as-a-judgeParams=-, N=82026.04 | 24.36 | — | — | |
| LLM-as-a-judgeParams=-, N=162026.04 | 24.36 | — | — | |
| Self-RewardingParams=-, N=42026.04 | 24.36 | — | — | |
| Self-RewardingParams=-, N=82026.04 | 24.36 | — | — | |
| Self-RewardingParams=-, N=162026.04 | 24.36 | — | — | |
| DataPRMParams=4B, N=42026.04 | 24.36 | — | — | |
| Majority VoteParams=-, N=162026.04 | 23.08 | — | — | |
| Qwen2.5-Math-PRM-72BParams=72B, N=42026.04 | 23.08 | — | — | |
| Qwen2.5-Math-PRM-72BParams=72B, N=82026.04 | 23.08 | — | — | |
| Math-Shepherd-PRM-7BParams=7B, N=82026.04 | 21.79 | — | — | |
| ReasonFlux-PRM-7BParams=7B, N=82026.04 | 21.79 | — | — | |
| ThinkPRMParams=14B, N=82026.04 | 21.79 | — | — | |
| GenPRMParams=32B, N=42026.04 | 21.79 | — | — | |
| MimosaMode=Iterative Learning, Model=GPT-4o2026.03 | 21.6 | 72.1 | 3.5 | |
| Math-Shepherd-PRM-7BParams=7B, N=162026.04 | 20.51 | — | — | |
| Qwen2.5-Math-PRM-7BParams=7B, N=82026.04 | 20.51 | — | — | |
| GenPRMParams=32B, N=82026.04 | 20.51 | — | — | |
| GenPRMParams=32B, N=162026.04 | 20.51 | — | — | |
| Qwen2.5-Math-PRM-72BParams=72B, N=162026.04 | 20.51 | — | — | |
| Math-Shepherd-PRM-7BParams=7B, N=42026.04 | 19.23 | — | — | |
| Qwen2.5-Math-PRM-7BParams=7B, N=42026.04 | 19.23 | — | — | |
| Qwen2.5-Math-PRM-7BParams=7B, N=162026.04 | 19.23 | — | — | |
| ReasonFlux-PRM-7BParams=7B, N=42026.04 | 19.23 | — | — | |
| ReasonFlux-PRM-7BParams=7B, N=162026.04 | 19.23 | — | — | |
| ThinkPRMParams=14B, N=42026.04 | 19.23 | — | — | |
| MimosaMode=Multi-Agent One-shot, Model=GPT-4o2026.03 | 18.6 | 64 | 1 | |
| ThinkPRMParams=14B, N=162026.04 | 17.95 | — | — | |
| MimosaMode=Single Agent (SmolAgent), Model=Mistral-Large-24072026.03 | 13.5 | 68.1 | 1.3 | |
| MimosaMode=Single Agent (SmolAgent), Model=Claude Haiku 4.52026.03 | 7.8 | 57 | 1.46 | |
| MimosaMode=Single Agent (SmolAgent), Model=GPT-4o2026.03 | 3.8 | 60.7 | 0.56 |