Agentic Search on Search Seen
51.6NQ AccuracyRESKILL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RESKILLModel Scale=Qwen3-4B-Instruct, Strategy=w/ RL2026.06 | 51.6 | 53.7 | 52.6 | |
| SkillRLModel Scale=Qwen3-4B-Instruct, Strategy=w/ RL2026.06 | 51 | 51.3 | 51.2 | |
| EvolveRModel Scale=Qwen3-4B-Instruct, Strategy=w/ RL2026.06 | 49.3 | 49.8 | 49.6 | |
| EvolveRModel Scale=Qwen3-8B, Strategy=w/ RL2026.06 | 49.3 | 53.1 | 51.2 | |
| RESKILLModel Scale=Qwen3-8B, Strategy=w/ RL2026.06 | 49 | 58.3 | 53.7 | |
| MemRL (+RL)Model Scale=Qwen3-4B-Instruct, Strategy=w/ RL2026.06 | 48.7 | 51.4 | 50.1 | |
| INSPOModel Scale=Qwen3-8B, Strategy=w/ RL2026.06 | 48.7 | 55.2 | 51.9 | |
| SkillRLModel Scale=Qwen3-8B, Strategy=w/ RL2026.06 | 48.7 | 56.1 | 52.4 | |
| INSPOModel Scale=Qwen3-4B-Instruct, Strategy=w/ RL2026.06 | 48.6 | 53.6 | 51.1 | |
| MemRL (+RL)Model Scale=Qwen3-8B, Strategy=w/ RL2026.06 | 48.3 | 54.8 | 51.6 | |
| GRPOModel Scale=Qwen3-4B-Instruct, Strategy=w/ RL2026.06 | 48 | 52.4 | 50.2 | |
| GRPOModel Scale=Qwen3-8B, Strategy=w/ RL2026.06 | 48 | 51.9 | 49.9 | |
| Best†Model Scale=Qwen3-8B, Strategy=w/ Skill2026.06 | 32.8 | 39.2 | 36 | |
| Best†Model Scale=Qwen3-4B-Instruct, Strategy=w/ Skill2026.06 | 31.6 | 36 | 33.6 | |
| Best‡Model Scale=Qwen3-4B-Instruct, Strategy=w/ Evolve2026.06 | 30.4 | 35.6 | 32.9 | |
| ReActModel Scale=Qwen3-8B, Strategy=Baseline2026.06 | 30.2 | 32 | 31.1 | |
| Best‡Model Scale=Qwen3-8B, Strategy=w/ Evolve2026.06 | 29.5 | 36.2 | 32.9 | |
| Sonnet 4.5Model Scale=Sonnet 4.5, Strategy=Proprietary2026.06 | 26.7 | 36.8 | 31.7 | |
| ReActModel Scale=Qwen3-4B-Instruct, Strategy=Baseline2026.06 | 21.3 | 30.3 | 25.8 |