DeepSearch Question Answering on General AI Assistant
61.5Score (Lv.1)APPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| APPOBackbone=Qwen3-14B, Method Strategy=APPO, Method Category=RL-based Method2026.06 | 61.5 | 42.3 | 16.7 | 46.6 | |
| APPOBackbone=Qwen3-8B, Method Strategy=APPO, Method Category=RL-based Method2026.06 | 59 | 36.5 | 16.7 | 42.7 | |
| ARPOBackbone=Qwen3-14B, Method Strategy=ARPO, Method Category=RL-based Method2026.06 | 56.4 | 40.4 | 16.7 | 43.7 | |
| ARPOBackbone=Qwen3-8B, Method Strategy=ARPO, Method Category=RL-based Method2026.06 | 53.9 | 32.7 | 16.7 | 38.8 | |
| GRPOBackbone=Qwen3-14B, Method Strategy=GRPO, Method Category=RL-based Method2026.06 | 51.3 | 34.6 | 0 | 36.9 | |
| GRPOBackbone=Qwen3-8B, Method Strategy=GRPO, Method Category=RL-based Method2026.06 | 48.7 | 25 | 8.3 | 32 | |
| Search-o1Backbone=Qwen3-14B, Method Strategy=Search-o1, Method Category=Single-Enhanced Method2026.06 | 48.7 | 23.1 | 0 | 30.1 | |
| WebThinkerBackbone=Qwen3-14B, Method Strategy=WebThinker, Method Category=Single-Enhanced Method2026.06 | 48.7 | 26.9 | 8.3 | 33 | |
| ReActBackbone=Qwen3-14B, Method Strategy=ReAct, Method Category=Single-Enhanced Method2026.06 | 48.7 | 25 | 8.3 | 32 | |
| WebThinkerBackbone=Qwen3-8B, Method Strategy=WebThinker, Method Category=Single-Enhanced Method2026.06 | 43.6 | 11.5 | 0 | 22.3 | |
| DeepSeek-R1-671BBackbone=DeepSeek-R1-671B, Method Category=Reference2026.06 | 40.5 | 21.2 | 5.2 | 25.2 | |
| Vanilla RAGBackbone=Qwen3-14B, Method Strategy=Vanilla RAG, Method Category=Single-Enhanced Method2026.06 | 38.5 | 19.2 | 8.3 | 25.2 | |
| Search-o1Backbone=Qwen3-8B, Method Strategy=Search-o1, Method Category=Single-Enhanced Method2026.06 | 35.9 | 15.4 | 0 | 21.4 | |
| ReActBackbone=Qwen3-8B, Method Strategy=ReAct, Method Category=Single-Enhanced Method2026.06 | 35.9 | 17.3 | 8.3 | 23.3 | |
| Qwen3-14BBackbone=Qwen3-14B, Method Strategy=Base, Method Category=RL-based Method2026.06 | 33.3 | 13.5 | 0 | 19.4 | |
| QwQ-32BBackbone=QwQ-32B, Method Category=Reference2026.06 | 30.9 | 6.5 | 5.2 | 18.9 | |
| Vanilla RAGBackbone=Qwen3-8B, Method Strategy=Vanilla RAG, Method Category=Single-Enhanced Method2026.06 | 28.2 | 15.4 | 16.7 | 20.4 | |
| Qwen3-8BBackbone=Qwen3-8B, Method Strategy=Base, Method Category=RL-based Method2026.06 | 28.1 | 15.4 | 16.7 | 20.4 | |
| Qwen3-32B-thinkingBackbone=Qwen3-32B, Method Category=Reference2026.06 | 26.2 | 12.1 | 0 | 14.9 | |
| GPT-4oBackbone=GPT-4o, Method Category=Reference2026.06 | 23.1 | 15.4 | 8.3 | 17.5 | |
| DeepSeek-R1-32BBackbone=DeepSeek-R1-32B, Method Category=Reference2026.06 | 21.5 | 13.6 | 0 | 14.2 |