Search Agent Evaluation on BC-ZH
66.6Average ScoreMiniMax-M2.1
Evaluation Results
| Method | Links | |
|---|---|---|
| MiniMax-M2.1Model Category=Foundation Model2026.05 | 66.6 | |
| DeepSeek-V3.2Model Category=Foundation Model2026.05 | 65 | |
| GPT-5 HighModel Category=Foundation Model2026.05 | 65 | |
| Qwen3-8B + ACTGUIDE-RLTraining=ACTGUIDE-RL2026.05 | 26.64 | |
| Qwen3-8BTraining=Base2026.05 | 23.52 | |
| Qwen3-8B + RLTraining=RL Baseline2026.05 | 21.79 | |
| Qwen3-4B-Instruct + ACTGUIDE-RLTraining=ACTGUIDE-RL2026.05 | 20.41 | |
| Qwen3-4B-Instruct + RLTraining=RL Baseline2026.05 | 15.26 | |
| WebSailor-7BModel Category=Search-Agent-Trained Model2026.05 | 14.2 | |
| Qwen2.5-7B-Instruct + ACTGUIDE-RLTraining=ACTGUIDE-RL2026.05 | 8.31 | |
| Qwen3-4B-InstructTraining=Base2026.05 | 7.96 | |
| WebThinker-32B-RLModel Category=Search-Agent-Trained Model2026.05 | 7.3 | |
| Qwen2.5-7B-Instruct + RLTraining=RL Baseline2026.05 | 4.84 | |
| Qwen2.5-3B-Instruct + ACTGUIDE-RLTraining=ACTGUIDE-RL2026.05 | 4.5 | |
| Qwen2.5-7B-InstructTraining=Base2026.05 | 4.5 | |
| Qwen2.5-3B-Instruct + RLTraining=RL Baseline2026.05 | 2.42 | |
| Qwen2.5-3B-InstructTraining=Base2026.05 | 2.08 |