Information Seeking on 20 Questions (20Qs) (test)
8.83Mean@8Qwen3-235B-Instr.
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-235B-Instr.Mode=Large API model2026.02 | 8.83 | 27.71 | |
| BASELINEModel Size=1.7B, Training=SFT2026.02 | 9.97 | 32.03 | |
| BASELINEModel Size=4B, Training=SFT2026.02 | 13.34 | 36.87 | |
| DeepSeek-V3.2Mode=Large API model2026.02 | 14.35 | 47.34 | |
| STARPOModel Size=1.7B, Strategy=Trajectory-level GRPO2026.02 | 16.54 | 45.73 | |
| STARPOModel Size=4B, Strategy=Trajectory-level GRPO2026.02 | 24.36 | 59.12 | |
| CIAModel Size=1.7B, Methodology=ΔBelief-RL / Turn-wise GRPO2026.02 | 24.8 | 53.1 | |
| CIAModel Size=4B, Methodology=ΔBelief-RL / Turn-wise GRPO2026.02 | 33.72 | 63.97 |