Scientific Reasoning on Science Domain In-Domain: SampleQA, GPQA(ALL), HLE
3.26SampleQA ScoreFlowRL
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| FlowRLtraining_domain=Science2026.02 | 3.26 | 4.17 | 3.24 | 3.56 | — | |
| DVPOBackbone=Qwen3-8B, Training Steps=5002025.12 | 3.21 | 4.71 | 3.57 | 3.83 | 39.63 | |
| Reinforce++training_domain=Science2026.02 | 3.19 | 4.35 | 3.29 | 3.61 | — | |
| Reinforce++Backbone=Qwen3-8B, Training Steps=5002025.12 | 3.19 | 4.35 | 3.29 | 3.61 | 37.72 | |
| KTAEtraining_domain=Science2026.02 | 3.17 | 3.99 | 2.64 | 3.27 | — | |
| DFPOtraining_domain=Science2026.02 | 3.17 | 5.43 | 4.03 | 4.21 | — | |
| Robust Bellmantraining_domain=Science2026.02 | 3.14 | 4.17 | 3.38 | 3.56 | — | |
| Robust BellmanBackbone=Qwen3-8B, Implementation=PPO based on robust Bellman operator, Training Steps=5002025.12 | 3.14 | 4.17 | 3.38 | 3.56 | 36.23 | |
| Basetraining_domain=Science2026.02 | 3.12 | 3.8 | 2.89 | 3.27 | — | |
| BAPOtraining_domain=Science2026.02 | 3.1 | 3.99 | 3.15 | 3.41 | — | |
| GRPOtraining_domain=Science2026.02 | 3.03 | 2.98 | 3.24 | 3.08 | — | |
| GRPOBackbone=Qwen3-8B, Training Steps=5002025.12 | 3.03 | 2.98 | 3.24 | 3.08 | 35.77 | |
| BaseBackbone=Qwen3-8B, Training Steps=5002025.12 | 2.89 | 3.1 | 2.89 | 2.96 | 34.64 | |
| PPOtraining_domain=Science2026.02 | 2.82 | 2.17 | 3.29 | 2.76 | — | |
| PPOBackbone=Qwen3-8B, Training Steps=5002025.12 | 2.82 | 2.17 | 3.29 | 2.76 | 37.34 | |
| λ-GRPOtraining_domain=Science2026.02 | 2.77 | 4.35 | 3.57 | 3.56 | — | |
| Dr. GRPOtraining_domain=Science2026.02 | 2.5 | 3.99 | 3.1 | 3.2 | — | |
| Dr.GRPOBackbone=Qwen3-8B, Training Steps=5002025.12 | 2.5 | 3.99 | 3.1 | 3.2 | 36.25 |