Multi-turn Agent Task on Search-QA
50.49Success RateGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOStudent Model=None, Teacher Model=Qwen3-30B-A3B GRPO2026.06 | 50.49 | 2.65 | |
| ATODStudent Model=Qwen3-4B, Teacher Model=Qwen3-30B-A3B GRPO2026.06 | 49.12 | 2.62 | |
| OPDStudent Model=Qwen3-4B, Teacher Model=Qwen3-30B-A3B GRPO2026.06 | 48.93 | 2.69 | |
| SODStudent Model=Qwen3-4B, Teacher Model=Qwen3-30B-A3B GRPO2026.06 | 48.58 | 2.61 | |
| TCODStudent Model=Qwen3-4B, Teacher Model=Qwen3-30B-A3B GRPO2026.06 | 48.39 | 2.57 | |
| GRPOStudent Model=None, Teacher Model=Qwen3-4B GRPO2026.06 | 48.19 | 2.51 | |
| GRPOStudent Model=Qwen3-4B, Teacher Model=None2026.06 | 48.19 | 2.51 | |
| TRIAGEModel=Qwen2.5-7B-Instruct, Judge=Qwen3-8B-thinking, Evidence=true2026.06 | 48.1 | — | |
| SDARStudent Model=Qwen3-4B, Teacher Model=None2026.06 | 47.8 | 2.59 | |
| TRIAGEModel=Qwen2.5-7B-Instruct, Judge=Qwen3-8B-thinking, Evidence=false2026.06 | 46.4 | — | |
| ATODStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-4B GRPO2026.06 | 45.21 | 2.64 | |
| TCODStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-4B GRPO2026.06 | 45.02 | 2.74 | |
| TRIAGEModel=Qwen2.5-7B-Instruct, Judge=Qwen3-8B no-think2026.06 | 45 | — | |
| OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-4B GRPO2026.06 | 44.73 | 2.66 | |
| SODStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-4B GRPO2026.06 | 44.43 | 2.69 | |
| GRPOModel=Qwen2.5-7B-Instruct2026.06 | 43.3 | — | |
| ATODStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-4B GRPO2026.06 | 42.33 | 2.77 | |
| TRIAGEModel=Qwen3-1.7B-Instruct, Judge=Qwen3-8B-thinking, Evidence=true2026.06 | 42.3 | — | |
| SDARStudent Model=Qwen3-1.7B, Teacher Model=None2026.06 | 42.24 | 2.67 | |
| TCODStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-4B GRPO2026.06 | 42.04 | 2.67 | |
| GRPOStudent Model=Qwen3-1.7B, Teacher Model=None2026.06 | 41.99 | 2.64 | |
| OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-4B GRPO2026.06 | 41.46 | 2.77 | |
| TRIAGEModel=Qwen3-1.7B-Instruct, Judge=Qwen3-8B-thinking, Evidence=false2026.06 | 41.1 | — | |
| TRIAGEModel=Qwen3-1.7B-Instruct, Judge=Qwen3-8B no-think2026.06 | 40.2 | — | |
| SODStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-4B GRPO2026.06 | 40.19 | 2.81 | |
| SDARStudent Model=Qwen3-0.6B, Teacher Model=None2026.06 | 39.6 | 2.43 | |
| GRPOModel=Qwen3-1.7B-Instruct2026.06 | 39.4 | — | |
| GRPOStudent Model=Qwen3-0.6B, Teacher Model=None2026.06 | 39.36 | 2.69 | |
| VanillaStudent Model=Qwen3-4B, Teacher Model=None2026.06 | 32.71 | 1.77 | |
| VanillaStudent Model=Qwen3-1.7B, Teacher Model=None2026.06 | 31.15 | 2.09 | |
| VanillaStudent Model=Qwen3-0.6B, Teacher Model=None2026.06 | 14.5 | 1.57 |