Multi-agent task completion on HiMA-Ecom (test)
98Math ScoreClaude3.5-sonnet
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Claude3.5-sonnetClosed-source=true2025.06 | 98 | 38 | 1 | 62.5 | 2 | 40.3 | |
| DeepSeek-R12025.06 | 98 | 37 | 24 | 72 | 7 | 47.6 | |
| DeepSeek-V32025.06 | 96 | 32 | 10 | 68 | 2 | 41.6 | |
| Multiagent Debatebackbone=Qwen2.5-14B, roles=32025.06 | 95 | 33 | 0 | 40.6 | 1 | 33.9 | |
| GPT-4oClosed-source=true2025.06 | 85 | 35 | 56 | 83 | 6 | 53 | |
| Qwen2.5-14Bmode=Single agent with RL2025.06 | 82 | 27 | 2 | 63.6 | 1 | 35.1 | |
| Qwen2.5-7Bmode=Single agent with RL2025.06 | 81 | 11 | 0 | 67.2 | 1 | 32 | |
| Qwen2.5-14B2025.06 | 80 | 29 | 0 | 42 | 1 | 30.4 | |
| HiMA-R1composition=7B Master + 3B Sub agents2025.06 | 75 | 35 | 46 | 73.1 | 9 | 47.6 | |
| Qwen2.5-32B2025.06 | 72 | 38 | 3 | 72 | 2 | 37.4 | |
| HiMA-R1composition=3B Master + 3B Sub agents2025.06 | 68 | 22 | 48 | 76 | 6 | 44 | |
| HiMA-SFTcomposition=7B Master + 3B Sub agents2025.06 | 65 | 13 | 42 | 73 | 3 | 39.2 | |
| Qwen2.5-3Bmode=Single agent with RL2025.06 | 56 | 9 | 0 | 58.5 | 1 | 24.9 | |
| GPT-4o miniClosed-source=true2025.06 | 47 | 31 | 0 | 65.5 | 0 | 28.7 |