Deep Search on xbench-DS
75AccuracyQwen3-30B-A3B-thinking-SFT + SAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-30B-A3B-thinking-SFT + SAPOContext Budget=128K2026.05 | 75 | |
| Tongyi DeepResearchContext Budget=128K2026.05 | 69 | |
| Qwen3-30B-A3B-thinking-SFT + GRPOContext Budget=128K2026.05 | 67 | |
| OpenAI-o3Context Budget=-2026.05 | 66.7 | |
| Qwen3-30B-A3B-thinking-SFTContext Budget=128K2026.05 | 53 | |
| Kimi K2Context Budget=-2026.05 | 50 | |
| Web-30B-E-GRPOContext Budget=-2026.05 | 48.5 | |
| Qwen3-8B-SFT + SAPOContext Budget=64K2026.05 | 22 | |
| Qwen3-8B-SFT + GRPOContext Budget=64K2026.05 | 20 | |
| Qwen3-8B-SFTContext Budget=64K2026.05 | 18 | |
| Qwen3-8B-SFT + ARPOContext Budget=64K2026.05 | 16 | |
| MiroThinker-v1.0-8BContext Budget=64K2026.05 | 13.3 | |
| WebSailor-32BContext Budget=32K2026.05 | 11 | |
| WebSailor-7BContext Budget=32K2026.05 | 9.3 | |
| MiroThinker-v1.5-30BContext Budget=128K2026.05 | 5 | |
| WebExplorer-8BContext Budget=64K2026.05 | 2 |