Skill-Augmented Agent Performance Evaluation on SkillsBench 86 runnable tasks (frozen-policy transfer)
79Valid Task CountPolicy-selected
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| Policy-selectedSetting=Claude Code + Opus 4.62026.06 | 79 | 87.4 | 0.7 | 1.03 | 0.63 | 0.87 | 0.86 | 0 | -0.13 | 14 | |
| Policy-selectedSetting=Codex + GPT-5.42026.06 | 78 | 86.2 | 0.68 | 1.03 | 0.63 | 0.84 | 0.83 | 0 | -0.16 | 16 | |
| Rule/formula anchoredSetting=Claude Code + Opus 4.62026.06 | 78 | 75.6 | 0.53 | 0.89 | 0.66 | 0.88 | 0.87 | 0 | -0.12 | 0 | |
| Workflow-guardedSetting=Claude Code + Opus 4.62026.06 | 78 | 83.2 | 0.63 | 0.98 | 0.59 | 1.05 | 1.02 | 5 | 0.05 | 0 | |
| Rule/formula anchoredSetting=Codex + GPT-5.42026.06 | 77 | 73.2 | 0.5 | 0.88 | 0.66 | 0.86 | 0.85 | 0 | -0.14 | 0 | |
| API/code anchoredSetting=Claude Code + Opus 4.62026.06 | 77 | 86.4 | 0.67 | 1.01 | 0.61 | 0.91 | 0.9 | 0 | -0.09 | — | |
| API/code anchoredSetting=Codex + GPT-5.42026.06 | 76 | 85.2 | 0.65 | 1.02 | 0.61 | 0.89 | 0.88 | 0 | -0.11 | 11 | |
| Original skillsSetting=Claude Code + Opus 4.62026.06 | 76 | 85.2 | 0.65 | 1 | 1 | 1 | 1 | 0 | 0 | 0 | |
| Policy-selectedSetting=Gemini-CLI + Gemini 3 Pro2026.06 | 75 | 82.2 | 0.61 | 1.04 | 0.63 | 0.88 | 0.87 | 0 | -0.12 | 12 | |
| Workflow-guardedSetting=Codex + GPT-5.42026.06 | 75 | 81 | 0.59 | 0.97 | 0.59 | 1.03 | 1 | 3 | 0.03 | 0 | |
| Rule/formula anchoredSetting=Gemini-CLI + Gemini 3 Pro2026.06 | 74 | 70.4 | 0.46 | 0.89 | 0.66 | 0.89 | 0.88 | 0 | -0.11 | 0 | |
| Original skillsSetting=Codex + GPT-5.42026.06 | 74 | 83.5 | 0.62 | 1 | 1 | 1 | 1 | 0 | 0 | 0 | |
| API/code anchoredSetting=Gemini-CLI + Gemini 3 Pro2026.06 | 73 | 80.8 | 0.58 | 1.02 | 0.61 | 0.92 | 0.91 | 0 | -0.08 | 8 | |
| Workflow-guardedSetting=Gemini-CLI + Gemini 3 Pro2026.06 | 73 | 77.8 | 0.54 | 0.98 | 0.59 | 1.07 | 1.04 | 7 | 0.07 | 0 | |
| Original skillsSetting=Gemini-CLI + Gemini 3 Pro2026.06 | 72 | 79.2 | 0.56 | 1 | 1 | 1 | 1 | 0 | 0 | 0 |