Agent-based interactive task execution on AppWorld
64.9AccuracySkill-SD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Skill-SDModel Backbone=Qwen3-4B-Instruct-25072026.04 | 64.9 | 84.9 | |
| Vanilla GRPOModel Backbone=Qwen3-4B-Instruct-25072026.04 | 50.9 | 76.3 | |
| Skill-Augmented GRPOModel Backbone=Qwen3-4B-Instruct-25072026.04 | 42.1 | 76.1 | |
| Vanilla OPDModel Backbone=Qwen3-4B-Instruct-25072026.04 | 22.8 | 59.7 | |
| Base ModelModel Backbone=Qwen3-4B-Instruct-25072026.04 | 8.8 | 39.1 |