Skill-based Task Execution on Skills-Bench robustness subset 24-task v0.3a3
0.668Mean Task RewardAIP-compiled skills
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| AIP-compiled skillsSolver=Claude Sonnet, Trials per task=52026.06 | 0.668 | 63.3 | 10 | 12 | 2 | 0.022 | |
| Human-curated skillsSolver=Claude Sonnet, Trials per task=52026.06 | 0.567 | 50.8 | — | — | — | — |