Multi-step reasoning on GAIA (test)
31Level 1 AccuracySkill-R1 (GRPO, Qwen3-4b)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Skill-R1 (GRPO, Qwen3-4b)Optimization Protocol=GRPO and bi-level advantages, Editor Model=Qwen3-4b, Task-solving model=GPT-4o-mini2026.05 | 31 | 28 | 10 | 69 | |
| Skill-R1 (Inference, Qwen3-4b)Optimization Protocol=Multi-generation rollout (frozen editor), Editor Model=Qwen3-4b, Task-solving model=GPT-4o-mini2026.05 | 22 | 21 | 8 | 51 | |
| Vanilla GRPO (Qwen3-4b)Optimization Protocol=Standard Group Relative Policy Optimization, Editor Model=Qwen3-4b, Task-solving model=GPT-4o-mini2026.05 | 21 | 24 | 4 | 49 | |
| GPT-4o-mini (no skills)Optimization Protocol=None, Editor Model=None, Task-solving model=GPT-4o-mini2026.05 | 4 | 6 | 0 | 10 |