Scientific Discovery on Average MBO, NHO, SPO, TMC
14.6Avg APDReAct
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ReActBackbone LLM=Qwen3-32B, Thinking Mode=Non-thinking2026.02 | 14.6 | 54.8 | |
| VanillaBackbone LLM=Qwen3-32B, Thinking Mode=Non-thinking2026.02 | 14.8 | 50.5 | |
| The AI Scientist v1Backbone LLM=Gemini-2.5-Flash, Thinking Mode=Non-thinking2026.02 | 14.9 | 59.6 | |
| ReActBackbone LLM=Gemini-2.5-Flash, Thinking Mode=Non-thinking2026.02 | 16.6 | 58.4 | |
| The AI Scientist v1Backbone LLM=Qwen3-32B, Thinking Mode=Non-thinking2026.02 | 20.5 | 56.2 | |
| The AI Scientist v2Backbone LLM=Gemini-2.5-Flash, Thinking Mode=Non-thinking2026.02 | 22.6 | 61.1 | |
| VanillaBackbone LLM=Gemini-2.5-Flash, Thinking Mode=Non-thinking2026.02 | 23.1 | 57.5 | |
| The AI Scientist v2Backbone LLM=Qwen3-32B, Thinking Mode=Non-thinking2026.02 | 24.1 | 55.9 | |
| AI ResearcherBackbone LLM=Qwen3-32B, Thinking Mode=Non-thinking2026.02 | 24.9 | 56.6 | |
| AI ResearcherBackbone LLM=Gemini-2.5-Flash, Thinking Mode=Non-thinking2026.02 | 26 | 49 | |
| PiFlowBackbone LLM=Gemini-2.5-Flash, Thinking Mode=Non-thinking2026.02 | 32 | 58.3 | |
| PiFlowBackbone LLM=Qwen3-32B, Thinking Mode=Non-thinking2026.02 | 44.8 | 62.9 | |
| PIEVOBackbone LLM=Qwen3-32B, Thinking Mode=Non-thinking2026.02 | 49.7 | 79.2 | |
| PIEVOBackbone LLM=Gemini-2.5-Flash, Thinking Mode=Non-thinking2026.02 | 54.7 | 84 |