General Reasoning on ARC-c (Pass@1)
82.51Pass@1Block-R1
Evaluation Results
| Method | Links | |
|---|---|---|
| Block-R1Source Domain=Multi-domain, Backbone=LLaDA-8B-Instruct2026.05 | 82.51 | |
| DPSBackbone=R1-Distill-7B, Finetuning=true, Rollouts=287k, Runtime=39h, Max response length=8k tokens, Training dataset=MATH2026.03 | 78.67 | |
| DS (Oracle)Backbone=R1-Distill-7B, Finetuning=true, Rollouts=1147k, Runtime=73h, Max response length=8k tokens, Training dataset=MATH2026.03 | 77.05 | |
| USBackbone=R1-Distill-7B, Finetuning=true, Rollouts=287k, Runtime=30h, Max response length=8k tokens, Training dataset=MATH2026.03 | 75.09 | |
| HRBackbone=R1-Distill-7B, Finetuning=true, Rollouts=287k, Runtime=36h, Max response length=8k tokens, Training dataset=MATH2026.03 | 74.57 | |
| R1-Distill-7BBackbone=R1-Distill-7B, Max response length=8k tokens, Training dataset=MATH2026.03 | 74.32 | |
| DPSBackbone=R1-Distill-1.5B, Finetuning=true, Rollouts=737k, Runtime=32h, Max response length=8k tokens, Training dataset=MATH2026.03 | 46.16 | |
| DS (Oracle)Backbone=R1-Distill-1.5B, Finetuning=true, Rollouts=2933k, Runtime=89h, Max response length=8k tokens, Training dataset=MATH2026.03 | 44.88 | |
| USBackbone=R1-Distill-1.5B, Finetuning=true, Rollouts=737k, Runtime=27h, Max response length=8k tokens, Training dataset=MATH2026.03 | 43.17 | |
| HRBackbone=R1-Distill-1.5B, Finetuning=true, Rollouts=737k, Runtime=28h, Max response length=8k tokens, Training dataset=MATH2026.03 | 42.83 | |
| R1-Distill-1.5BBackbone=R1-Distill-1.5B, Max response length=8k tokens, Training dataset=MATH2026.03 | 41.81 |