Tool Use Reasoning on Tool use
61.31Mean Accuracy @16GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GRPOModel Size=Qwen3-8B, Training Domain=Material2026.05 | 61.31 | — | — | |
| GRPOModel Size=Qwen3-4B, Training Domain=Material2026.05 | 60.85 | — | — | |
| GRPOModel Size=Qwen3-8B, Training Domain=Chemistry2026.05 | 60.23 | — | — | |
| GRPOModel Size=Qwen3-8B, Training Domain=Physics2026.05 | 59.93 | — | — | |
| SDPOModel Size=Qwen3-8B, Training Domain=Biology2026.05 | 59.44 | — | — | |
| ROSDModel Size=Qwen3-8B, Training Domain=Biology2026.05 | 59.38 | — | — | |
| ROSDModel Size=Qwen3-8B, Training Domain=Material2026.05 | 59.38 | — | — | |
| ROSDModel Size=Qwen3-8B, Training Domain=Physics2026.05 | 59.19 | — | — | |
| GRPOModel Size=Qwen3-8B, Training Domain=Biology2026.05 | 59.16 | — | — | |
| GRPOModel Size=Qwen3-4B, Training Domain=Physics2026.05 | 58.98 | — | — | |
| GRPOModel Size=Qwen3-4B, Training Domain=Chemistry2026.05 | 58.92 | — | — | |
| GRPOModel Size=Qwen3-4B, Training Domain=Biology2026.05 | 58.85 | — | — | |
| ROSDModel Size=Qwen3-8B, Training Domain=Chemistry2026.05 | 58.27 | — | — | |
| ROSDModel Size=Qwen3-4B, Training Domain=Physics2026.05 | 57.17 | — | — | |
| SDPOModel Size=Qwen3-4B, Training Domain=Biology2026.05 | 57.05 | — | — | |
| ROSDModel Size=Qwen3-4B, Training Domain=Chemistry2026.05 | 57.05 | — | — | |
| ROSDModel Size=Qwen3-4B, Training Domain=Biology2026.05 | 56.46 | — | — | |
| ROSDModel Size=Qwen3-4B, Training Domain=Material2026.05 | 55.15 | — | — | |
| SDPOModel Size=Qwen3-4B, Training Domain=Material2026.05 | 54.87 | — | — | |
| SDPOModel Size=Qwen3-4B, Training Domain=Physics2026.05 | 54.01 | — | — | |
| SDPOModel Size=Qwen3-4B, Training Domain=Chemistry2026.05 | 39.64 | — | — | |
| SDPOModel Size=Qwen3-8B, Training Domain=Physics2026.05 | 2.27 | — | — | |
| SDPOModel Size=Qwen3-8B, Training Domain=Material2026.05 | 0.86 | — | — | |
| SDPOModel Size=Qwen3-8B, Training Domain=Chemistry2026.05 | 0.83 | — | — | |
| GRPOBackbone=Qwen3-8B, Algorithm=GRPO, Policy Type=off-policy2026.01 | — | 64.9 | 67.7 | |
| GRPOBackbone=Olmo3-7B-Instruct, Algorithm=GRPO, Policy Type=off-policy2026.01 | — | 56.4 | 65 | |
| GRPO (on-policy)Backbone=Qwen3-8B, Algorithm=GRPO, Policy Type=on-policy2026.01 | — | 60.2 | 65.7 | |
| GRPO (on-policy)Backbone=Olmo3-7B-Instruct, Algorithm=GRPO, Policy Type=on-policy2026.01 | — | 56.8 | 60.6 | |
| Olmo3-7B-InstructBackbone=Olmo3-7B-Instruct, Algorithm=None, Policy Type=N/A2026.01 | — | 39.3 | — | |
| Qwen3-8BBackbone=Qwen3-8B, Algorithm=None, Policy Type=N/A2026.01 | — | 57.5 | — | |
| SDPO (on-policy)Backbone=Qwen3-8B, Algorithm=SDPO, Policy Type=on-policy2026.01 | — | 68 | 68.5 | |
| SDPO (on-policy)Backbone=Olmo3-7B-Instruct, Algorithm=SDPO, Policy Type=on-policy2026.01 | — | 60.8 | 62.1 |