Scientific Reasoning on Chemistry
71.6Avg Score @16 (1h)SDPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SDPOModel Scale=8B2026.04 | 71.6 | 80.6 | — | 80.6 | |
| SDPOModel Scale=4B2026.04 | 70 | 77.3 | — | 77.3 | |
| SRPOModel Scale=8B2026.04 | 69.2 | 81.8 | — | 83 | |
| SRPOModel Scale=4B2026.04 | 68.8 | 81 | — | 82.7 | |
| GRPOModel Scale=4B2026.04 | 64.1 | 76.9 | — | 78.3 | |
| GRPOModel Scale=8B2026.04 | 62.1 | 75.9 | — | 78.9 | |
| SDPO (on-policy)Backbone=Qwen3-8B, Algorithm=SDPO, Policy Type=on-policy2026.01 | 60 | 70.1 | — | — | |
| SDPO (on-policy)Backbone=Olmo3-7B-Instruct, Algorithm=SDPO, Policy Type=on-policy2026.01 | 59.2 | 76.8 | — | — | |
| GRPOBackbone=Qwen3-8B, Algorithm=GRPO, Policy Type=off-policy2026.01 | 54.7 | 60 | — | — | |
| GRPO (on-policy)Backbone=Qwen3-8B, Algorithm=GRPO, Policy Type=on-policy2026.01 | 54.2 | 69.6 | — | — | |
| GRPO (on-policy)Backbone=Olmo3-7B-Instruct, Algorithm=GRPO, Policy Type=on-policy2026.01 | 48.8 | 54.3 | — | — | |
| Qwen3-4BModel Scale=4B2026.04 | 43.6 | — | — | — | |
| Qwen3-8BModel Scale=8B2026.04 | 41.1 | — | — | — | |
| Qwen3-8BBackbone=Qwen3-8B, Algorithm=None, Policy Type=N/A2026.01 | 35.6 | — | — | — | |
| GRPOBackbone=Olmo3-7B-Instruct, Algorithm=GRPO, Policy Type=off-policy2026.01 | 32.7 | 46.8 | — | — | |
| Olmo3-7B-InstructBackbone=Olmo3-7B-Instruct, Algorithm=None, Policy Type=N/A2026.01 | 18.8 | — | — | — | |
| GRPOBackbone=Qwen3-8B, Training Time=1h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 54.2 | — | |
| GRPOBackbone=Qwen3-8B, Training Time=5h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 69.6 | — | |
| GRPOBackbone=Olmo3-7B-Instruct, Training Time=1h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 42.7 | — | |
| GRPOBackbone=Olmo3-7B-Instruct, Training Time=5h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 54.3 | — | |
| GRPO (on-policy)Backbone=Qwen3-8B, Training Time=1h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 54.2 | — | |
| GRPO (on-policy)Backbone=Qwen3-8B, Training Time=5h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 69.6 | — | |
| GRPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=1h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 48.8 | — | |
| GRPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=5h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 54.3 | — | |
| Olmo3-7B-InstructTraining Time=0h, Hyperparameter Selection Protocol=Base model2026.01 | — | — | 18.8 | — | |
| Qwen3-8BTraining Time=0h, Hyperparameter Selection Protocol=Base model2026.01 | — | — | 35.6 | — | |
| SDPO (on-policy)Backbone=Qwen3-8B, Training Time=1h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 59.9 | — | |
| SDPO (on-policy)Backbone=Qwen3-8B, Training Time=5h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 70.1 | — | |
| SDPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=1h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 59.2 | — | |
| SDPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=5h, Hyperparameter Selection Protocol=Optimal based on 5h accuracy2026.01 | — | — | 76.8 | — |