Reasoning on ARC Challenge (Accuracy)
94.3AccuracyGGRO
Evaluation Results
| Method | Links | |
|---|---|---|
| GGROModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 94.3 | |
| BoN (N=64)Model=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 92.8 | |
| RSModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 92.3 | |
| ARGS-GModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 92 | |
| CARDSModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 91.8 | |
| CBSModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 90.5 | |
| SEAModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 87.8 | |
| CBSModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 87.5 | |
| RSModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 86 | |
| BoN (N=64)Model=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 86 | |
| GGROModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 86 | |
| Vanilla LLMModel=LLaMA-3.1-8B-Instruct + Skywork-Reward-V2-LLaMA-3.1-8B2026.06 | 84 | |
| ARGS-GModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 84 | |
| CARDSModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 82.8 | |
| Vanilla LLMModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 80 | |
| SEAModel=LLaMA-3.2-3B-Instruct + GRM-LLaMA-3.2-3B-rewardmodel-ft2026.06 | 76 | |
| FP16BIT=16, Evaluation Protocol=Few-shot2026.07 | 62.37 | |
| GSRQBIT=2, Evaluation Protocol=Few-shot2026.07 | 59.3 | |
| VQLLMBIT=2, Evaluation Protocol=Few-shot2026.07 | 57.76 | |
| LizardTok. (B)=0.04, Cache Size=1322026.07 | 56.7 | |
| STILL (concurrent)Tok. (B)=0.04, Cache Size=NA2026.07 | 56.7 | |
| Liger-GLATok. (B)=0.02, Cache Size=642026.07 | 55.6 | |
| LoLaTok. (B)=0.04, Cache Size=1282026.07 | 55.4 | |
| OURS (GDN)Tok. (B)=0.01, Cache Size=64, Param.=10.3M2026.07 | 54.92 | |
| OURS (GDN)Tok. (B)=0.01, Cache Size=128, Param.=10.3M2026.07 | 54.86 | |
| LLaMA 3.1 8BCache Size=∞2026.07 | 54.78 | |
| LlambaTok. (B)=12, Cache Size=0, Param.=8B2026.07 | 54.6 | |
| LolCaTTok. (B)=0.04, Cache Size=642026.07 | 54.44 | |
| Llama 3-8BParadigm=AR, Training Tokens=15T, Training Data=Not Released, Evaluation protocol=Reported by prior work, Shots=02026.06 | 53.1 | |
| GSRQBIT=1, Evaluation Protocol=Few-shot2026.07 | 52.05 | |
| LLaDA-8BParadigm=Masked Diffusion, Training Tokens=2.3T, Training Data=Not Released, Evaluation protocol=Reported by prior work, Shots=02026.06 | 45.9 | |
| GSRQBIT=0.75, Evaluation Protocol=Few-shot2026.07 | 45.22 | |
| Llama 2-7BParadigm=AR, Training Tokens=2T, Training Data=Not Released, Evaluation protocol=Evaluated under our protocol, Shots=02026.06 | 45.1 | |
| PivotTraceBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 44.7 | |
| Falcon-7BParadigm=AR, Training Tokens=1.5T, Training Data=Partially Released, Evaluation protocol=Evaluated under our protocol, Shots=02026.06 | 43.2 | |
| Sumi-7BParadigm=Uniform Diffusion, Training Tokens=1.5T, Training Data=Fully Released, Evaluation protocol=Evaluated under our protocol, Shots=02026.06 | 43 | |
| EntropyBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 41.7 | |
| ConsistencyBackbone=Deepseek-R1-Distill-Qwen-1.5B, Multiple stochastic inferences=true2026.06 | 40.8 | |
| OLMo-7BParadigm=AR, Training Tokens=2.5T, Training Data=Fully Released, Evaluation protocol=Evaluated under our protocol, Shots=02026.06 | 40.3 | |
| VQLLMBIT=1, Evaluation Protocol=Few-shot2026.07 | 37.03 | |
| CoEBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 36.7 | |
| RandomBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 36.1 | |
| Self-CertaintyBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 32.7 | |
| CoT-KineticsBackbone=Deepseek-R1-Distill-Qwen-1.5B2026.06 | 32.3 |