Scientific Reasoning on GPQA (Mean@1)
68.3Mean@1Agentic Proposing
Evaluation Results
| Method | Links | |
|---|---|---|
| Agentic ProposingTraining Data=Agentic-Proposer-4B Generated Problems, Training Budget=10,000 trajectories, Optimizer=GRPO2026.02 | 68.3 | |
| Qwen3-4B-Instruct-2507Protocol=zero-shot2026.02 | 62 | |
| DAREBackbone=Qwen3-1.7B, Method Category=Test-time scaling methods2026.01 | 32.7 | |
| TTRLBackbone=Qwen3-1.7B, Method Category=Test-time scaling methods2026.01 | 31.2 | |
| GRPOBackbone=Qwen3-1.7B, Method Category=RL methods on training dataset2026.01 | 31.1 | |
| RLPRBackbone=Qwen3-1.7B, Method Category=Test-time scaling methods2026.01 | 31 | |
| REINFORCE++Backbone=Qwen3-1.7B, Method Category=RL methods on training dataset2026.01 | 30.8 | |
| CO-REWARDING-IBackbone=Qwen3-1.7B, Method Category=Test-time scaling methods2026.01 | 30.5 | |
| REINFORCEBackbone=Qwen3-1.7B, Method Category=RL methods on training dataset2026.01 | 30.2 | |
| CoTBackbone=Qwen2.5-Math-1.5B, Method Category=Prompt methods (training-free)2026.01 | 28.6 | |
| DAREBackbone=Qwen2.5-Math-1.5B, Method Category=Test-time scaling methods2026.01 | 28.5 | |
| INTUITORBackbone=Qwen3-1.7B, Method Category=Test-time scaling methods2026.01 | 28.5 | |
| Raw modelBackbone=Qwen2.5-Math-1.5B, Method Category=Prompt methods (training-free)2026.01 | 27.8 | |
| CoTBackbone=Qwen3-1.7B, Method Category=Prompt methods (training-free)2026.01 | 27.6 | |
| Raw modelBackbone=Qwen3-1.7B, Method Category=Prompt methods (training-free)2026.01 | 26.8 | |
| RLPRBackbone=Qwen2.5-Math-1.5B, Method Category=Test-time scaling methods2026.01 | 26.5 | |
| GRPOBackbone=Qwen2.5-Math-1.5B, Method Category=RL methods on training dataset2026.01 | 26.1 | |
| TTRLBackbone=Qwen2.5-Math-1.5B, Method Category=Test-time scaling methods2026.01 | 26.1 | |
| REINFORCE++Backbone=Qwen2.5-Math-1.5B, Method Category=RL methods on training dataset2026.01 | 25.9 | |
| CO-REWARDING-IBackbone=Qwen2.5-Math-1.5B, Method Category=Test-time scaling methods2026.01 | 25.8 | |
| REINFORCEBackbone=Qwen2.5-Math-1.5B, Method Category=RL methods on training dataset2026.01 | 25.2 | |
| INTUITORBackbone=Qwen2.5-Math-1.5B, Method Category=Test-time scaling methods2026.01 | 23.5 |