Abstract Visual Reasoning on ARC-AGI 1
98Accuracy (Pass@2)best.human
Evaluation Results
| Method | Links | |
|---|---|---|
| best.human2026.02 | 98 | |
| Bespoke (Grok-4)#Params=1.7T2026.02 | 79.6 | |
| Bespoke (Grok-4)#params=1.7T, type=large language models (LLMs)2026.04 | 79.6 | |
| Grok-4-thinking#Params=1.7T2026.02 | 66.7 | |
| Grok-4-thinking#params=1.7T, type=large language models (LLMs)2026.04 | 66.7 | |
| Loop-ViT (Large)#Params=18M2026.02 | 65.8 | |
| Loop-ViT (Medium)#Params=11.2M2026.02 | 63.8 | |
| VARC (ensemble)#Params=73M2026.02 | 60.4 | |
| avg.human2026.02 | 60.2 | |
| Loop-ViT (Small)#Params=3.8M2026.02 | 60.1 | |
| Enc-Dec ViT+KoPE#params=37M2026.04 | 56.8 | |
| Enc-Dec ViT#params=36M2026.04 | 54.7 | |
| VARC#Params=18M2026.02 | 54.5 | |
| ViT#params=18M, type=vision models (VARC)2026.04 | 54.5 | |
| ViT#params=66M, type=vision models (VARC)2026.04 | 53 | |
| TRM#Params=7M2026.02 | 44.6 | |
| TRM#params=7M, type=recurrent models2026.04 | 44.6 | |
| GPT-52026.02 | 44 | |
| GPT-5#params=N/A, type=large language models (LLMs)2026.04 | 44 | |
| HRM#Params=27M2026.02 | 40.3 | |
| HRM#params=27M, type=recurrent models2026.04 | 40.3 | |
| o3-mini-high2026.02 | 34.5 | |
| o3-mini-high#params=N/A, type=large language models (LLMs)2026.04 | 34.5 | |
| Claude 3.7 8k2026.02 | 21.2 | |
| Claude 3.7 8k#params=N/A, type=large language models (LLMs)2026.04 | 21.2 | |
| Deepseek R1#Params=671B2026.02 | 15.8 | |
| Deepseek R1#params=671B, type=large language models (LLMs)2026.04 | 15.8 |