Application Tool-use Reasoning on AppWorld
22.36Avg@8SC-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SC-GRPOLearning Paradigm=Self-Conditioned GRPO2026.06 | 22.36 | 49.12 | |
| DAPOLearning Paradigm=Reinforcement Learning2026.06 | 13.99 | 33.33 | |
| GRPOLearning Paradigm=Reinforcement Learning2026.06 | 12.5 | 33.33 | |
| MiniMax-M2.7Learning Paradigm=On-Policy Self Distillation, External Demonstration LLM=True2026.06 | 9.87 | 35.08 | |
| Qwen3-8BLearning Paradigm=Base Model2026.06 | 9.65 | 26.31 | |
| DeepSeekv4-ProLearning Paradigm=On-Policy Self Distillation, External Demonstration LLM=True2026.06 | 9.43 | 29.82 | |
| OracleLearning Paradigm=On-Policy Self Distillation, Thinking Budget=Extended2026.06 | 9.43 | 31.57 |