Scientific Reasoning on Physics
69.5Avg@16 (1h)SRPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SRPOModel Scale=8B2026.04 | 69.5 | 77.1 | — | 78.4 | |
| SRPOModel Scale=4B2026.04 | 69.2 | 74 | — | 74 | |
| SDPOModel Scale=8B2026.04 | 67.6 | 74 | — | 74 | |
| SDPO (on-policy)Backbone=Qwen3-8B, Algorithm=SDPO, Policy Type=on-policy2026.01 | 66.6 | 75.6 | — | — | |
| SDPOModel Scale=4B2026.04 | 65.4 | 66.7 | — | 66.7 | |
| GRPOModel Scale=4B2026.04 | 64.8 | 71.9 | — | 71.9 | |
| GRPOBackbone=Qwen3-8B, Algorithm=GRPO, Policy Type=off-policy2026.01 | 63.8 | 72.7 | — | — | |
| GRPO (on-policy)Backbone=Qwen3-8B, Algorithm=GRPO, Policy Type=on-policy2026.01 | 63.6 | 63.6 | — | — | |
| GRPO (on-policy)Backbone=Olmo3-7B-Instruct, Algorithm=GRPO, Policy Type=on-policy2026.01 | 62.7 | 62.7 | — | — | |
| GRPOModel Scale=8B2026.04 | 61 | 72.3 | — | 73.6 | |
| SDPO (on-policy)Backbone=Olmo3-7B-Instruct, Algorithm=SDPO, Policy Type=on-policy2026.01 | 59.9 | 66.1 | — | — | |
| Qwen3-4BModel Scale=4B2026.04 | 59.8 | — | — | — | |
| Qwen3-8BBackbone=Qwen3-8B, Algorithm=None, Policy Type=N/A2026.01 | 59.2 | — | — | — | |
| Qwen3-8BModel Scale=8B2026.04 | 58.7 | — | — | — | |
| GRPOBackbone=Olmo3-7B-Instruct, Algorithm=GRPO, Policy Type=off-policy2026.01 | 55.3 | 63.3 | — | — | |
| Olmo3-7B-InstructBackbone=Olmo3-7B-Instruct, Algorithm=None, Policy Type=N/A2026.01 | 37.7 | — | — | — | |
| GRPOBackbone=Qwen3-8B, Training Time=1h2026.01 | — | — | 62.9 | — | |
| GRPOBackbone=Qwen3-8B, Training Time=5h2026.01 | — | — | 74.5 | — | |
| GRPOBackbone=Olmo3-7B-Instruct, Training Time=1h2026.01 | — | — | 55.3 | — | |
| GRPOBackbone=Olmo3-7B-Instruct, Training Time=5h2026.01 | — | — | 63.3 | — | |
| GRPO (on-policy)Backbone=Qwen3-8B, Training Time=1h2026.01 | — | — | 62.9 | — | |
| GRPO (on-policy)Backbone=Qwen3-8B, Training Time=5h2026.01 | — | — | 74.8 | — | |
| GRPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=1h2026.01 | — | — | 62.7 | — | |
| GRPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=5h2026.01 | — | — | 62.7 | — | |
| Olmo3-7B-InstructTraining Time=0h2026.01 | — | — | 37.7 | — | |
| Qwen3-8BTraining Time=0h2026.01 | — | — | 59.2 | — | |
| SDPO (on-policy)Backbone=Qwen3-8B, Training Time=1h2026.01 | — | — | 70.6 | — | |
| SDPO (on-policy)Backbone=Qwen3-8B, Training Time=5h2026.01 | — | — | 80.6 | — | |
| SDPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=1h2026.01 | — | — | 60.3 | — | |
| SDPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=5h2026.01 | — | — | 71.4 | — |