Web-based Reasoning on WebShop (Avg@8, Pass@8)
77.88Avg@8 Success RateSC-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SC-GRPOLearning Paradigm=Self-Conditioned GRPO2026.06 | 77.88 | 79.25 | |
| DAPOLearning Paradigm=Reinforcement Learning2026.06 | 71.5 | 75 | |
| GRPOLearning Paradigm=Reinforcement Learning2026.06 | 68.93 | 69.4 | |
| MiniMax-M2.7Learning Paradigm=On-Policy Self Distillation, External Demonstration LLM=True2026.06 | 11.4 | 20 | |
| OracleLearning Paradigm=On-Policy Self Distillation, Thinking Budget=Extended2026.06 | 10.38 | 21.6 | |
| DeepSeekv4-ProLearning Paradigm=On-Policy Self Distillation, External Demonstration LLM=True2026.06 | 9.88 | 16.8 | |
| Qwen3-8BLearning Paradigm=Base Model2026.06 | 8.13 | 14 |