Multi-turn Decision Making on tau2-Bench held-out (test)
41.9Average ScoreCURATEEVO
Evaluation Results
| Method | Links | |
|---|---|---|
| CURATEEVOModel=QWEN3-4B, Data Setting=Labeled Data2026.07 | 41.9 | |
| EnvScalerModel=QWEN3-8B, Data Setting=Labeled Data2026.07 | 37.9 | |
| CURATEEVOModel=QWEN3-4B, Data Setting=Wild Data2026.07 | 37.2 | |
| EnvScalerModel=QWEN3-8B, Data Setting=Wild Data2026.07 | 35.5 | |
| AWMModel=QWEN3-8B, Data Setting=Labeled Data2026.07 | 33.5 | |
| MUA-RLModel=QWEN3-8B, Data Setting=Labeled Data2026.07 | 32.8 | |
| GRPO w/o. Data CurationModel=QWEN3-8B, Data Setting=Labeled Data2026.07 | 31.8 | |
| AWMModel=QWEN3-8B, Data Setting=Wild Data2026.07 | 31.8 | |
| RODSModel=QWEN3-4B, Data Setting=Labeled Data2026.07 | 31.6 | |
| MUA-RLModel=QWEN3-8B, Data Setting=Wild Data2026.07 | 30.6 | |
| FunReason-MTModel=QWEN3-4B, Data Setting=Labeled Data2026.07 | 30.2 | |
| GRPO w/o. Data CurationModel=QWEN3-8B, Data Setting=Wild Data2026.07 | 29.6 | |
| RODSModel=QWEN3-4B, Data Setting=Wild Data2026.07 | 29.6 | |
| FunReason-MTModel=QWEN3-4B, Data Setting=Wild Data2026.07 | 27.8 | |
| GRPO w/o. Data CurationModel=QWEN3-4B, Data Setting=Labeled Data2026.07 | 26.8 | |
| GRPO w/o. Data CurationModel=QWEN3-4B, Data Setting=Wild Data2026.07 | 24.6 |