Question Answering on SSP Evaluation Suite (DeepSeek-V3 V3.2 Judge)
57.2NQ AccuracySSP
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| SSPInitialization=Search-R1-7B, Regime=Continual Training on Search-Specialized Agents2026.05 | 57.2 | 77 | 58.8 | 56.2 | 46.2 | 30.2 | 55.2 | 54.4 | |
| WCRInitialization=Search-R1-7B, Regime=Continual Training on Search-Specialized Agents2026.05 | 55.8 | 77.4 | 58.4 | 59.8 | 49 | 31.4 | 54.4 | 55.2 | |
| Search-R1-7BRegime=Continual Training on Search-Specialized Agents2026.05 | 55.6 | 74.4 | 56.4 | 57.2 | 43.8 | 27.6 | 52.8 | 52.5 | |
| WCRInitialization=LLaMA-3.1-8B, Regime=Generalization Across Model Families2026.05 | 55.2 | 76.8 | 53 | 48.4 | 31.2 | 16.6 | 40 | 45.9 | |
| WCRInitialization=Qwen3-8B, Regime=Generalization Across Model Families2026.05 | 54.8 | 79.7 | 56 | 60 | 51.1 | 26 | 65.2 | 56.1 | |
| SSPInitialization=Qwen3-8B, Regime=Generalization Across Model Families2026.05 | 54.6 | 79.6 | 58.2 | 57.4 | 49.6 | 24.4 | 60.8 | 54.9 | |
| WCRInitialization=Qwen2.5-7B-Instruct, Regime=Training from Base and Instruct Initializations2026.05 | 53.8 | 73.8 | 49 | 54.4 | 42.4 | 24.2 | 48.8 | 49.5 | |
| WCRInitialization=ZeroSearch-7B, Regime=Continual Training on Search-Specialized Agents2026.05 | 53.6 | 74 | 52.2 | 45.8 | 34 | 17 | 44 | 45.8 | |
| SSPInitialization=Qwen2.5-7B-Base, Regime=Training from Base and Instruct Initializations2026.05 | 53 | 72.8 | 52 | 46.4 | 30.8 | 19.6 | 40 | 44.9 | |
| SSPInitialization=Qwen2.5-7B-Instruct, Regime=Training from Base and Instruct Initializations2026.05 | 52.4 | 70.9 | 52.2 | 49.4 | 36.6 | 21.8 | 46.4 | 47.1 | |
| SSPInitialization=LLaMA-3.1-8B, Regime=Generalization Across Model Families2026.05 | 52.4 | 76 | 53.4 | 46.6 | 29.4 | 16.6 | 36.8 | 44.5 | |
| WCRInitialization=Qwen2.5-7B-Base, Regime=Training from Base and Instruct Initializations2026.05 | 52 | 75.6 | 52.2 | 52 | 42 | 22.4 | 49.6 | 49.4 | |
| Qwen3-8BRegime=Generalization Across Model Families2026.05 | 50.4 | 77.2 | 50.2 | 50.8 | 50.4 | 22.4 | 55.2 | 50.9 | |
| SSPInitialization=ZeroSearch-7B, Regime=Continual Training on Search-Specialized Agents2026.05 | 50.4 | 69 | 54.8 | 45.4 | 38.4 | 18.4 | 40.2 | 45.2 | |
| ZeroSearch-7BRegime=Continual Training on Search-Specialized Agents2026.05 | 49.8 | 66.6 | 52 | 41.4 | 32.2 | 17 | 40 | 42.7 | |
| LLaMA-3.1-8BRegime=Generalization Across Model Families2026.05 | 47.2 | 65.8 | 45.2 | 34.8 | 17 | 12.2 | 27.2 | 35.6 | |
| Qwen2.5-7B-InstructRegime=Training from Base and Instruct Initializations2026.05 | 42.6 | 63.4 | 37.4 | 42.8 | 31.8 | 14.8 | 43.2 | 39.4 | |
| Qwen2.5-7B-BaseRegime=Training from Base and Instruct Initializations2026.05 | 30.8 | 33.8 | 22.6 | 17.4 | 10.7 | 10.9 | 25.6 | 21.7 |