Mathematical Reasoning on Minerva (Accuracy and Average)
50.4AccuracyQwen2.5-7B-Instruct
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-7B-InstructArchitecture=Qwen2.5-7B, Training Stage=AR LLM2026.06 | 50.4 | 54.5 | |
| Llama3.1-8B-InstructArchitecture=Llama3.1-8B, Training Stage=AR LLM2026.06 | 37.5 | 42.7 | |
| AGDOArchitecture=Dream-v0-Instruct-7B, Training Stage=RL, Sampling Temperature=0.1, Decoding Strategy=Static decoding, Max Response Length=1,0242026.06 | 17 | 38.8 | |
| TraceRLArchitecture=Dream-v0-Instruct-7B, Training Stage=RL, Sampling Temperature=0.1, Decoding Strategy=Static decoding, Max Response Length=1,0242026.06 | 16.4 | 36.5 | |
| AGDO-RLArchitecture=Dream-v0-Instruct-7B, Training Stage=RL, Sampling Temperature=0.1, Decoding Strategy=Static decoding, Max Response Length=1,0242026.06 | 16.1 | 38.1 | |
| AGDO-SFTArchitecture=Dream-v0-Instruct-7B, Training Stage=SFT, Sampling Temperature=0.1, Decoding Strategy=Static decoding, Max Response Length=1,0242026.06 | 15.3 | 36 | |
| Diff-GRPOArchitecture=Dream-v0-Instruct-7B, Training Stage=RL, Sampling Temperature=0.1, Decoding Strategy=Static decoding, Max Response Length=1,0242026.06 | 15.3 | 35 | |
| SFTArchitecture=Dream-v0-Instruct-7B, Training Stage=SFT, Sampling Temperature=0.1, Decoding Strategy=Static decoding, Max Response Length=1,0242026.06 | 14.8 | 33.9 | |
| Coupled RLArchitecture=Dream-v0-Instruct-7B, Training Stage=RL, Sampling Temperature=0.1, Decoding Strategy=Static decoding, Max Response Length=1,0242026.06 | 14.1 | 34.9 | |
| blockwise SFTArchitecture=Dream-v0-Instruct-7B, Training Stage=SFT, Sampling Temperature=0.1, Decoding Strategy=Static decoding, Max Response Length=1,0242026.06 | 12.3 | 34.4 | |
| LLaDA-8B-InstructArchitecture=LLaDA-8B, Training Stage=Masked DLLM2026.06 | 11.9 | 28.5 | |
| Dream-v0-Instruct-7BArchitecture=Dream-v0-Instruct-7B, Training Stage=Masked DLLM2026.06 | 11.6 | 28.3 |