General Reasoning on BBEH
78.8AccuracyGemini 3-Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini 3-Pro2026.02 | 78.8 | — | |
| GPT-5 (High)2026.02 | 69 | — | |
| Gemini 2.5-Pro2026.02 | 68.8 | — | |
| DS V3.2-Thinking2026.02 | 67.04 | — | |
| ERNIE 5.02026.02 | 66.63 | — | |
| WISTBackbone=Qwen3-14B-Base2026.03 | 15.3 | — | |
| SPICEBackbone=Qwen3-14B-Base2026.03 | 15.2 | — | |
| SPICEBackbone=Qwen3-8B-Base, Methodology=SPICE, Supervision Ratio=None2025.12 | 14.9 | — | |
| R-ZeroBackbone=Qwen3-14B-Base2026.03 | 14.9 | — | |
| + SPICEBackbone=Qwen3-8B-Base, #Data=20K2026.05 | 14.9 | — | |
| SPICEModel Backbone=Qwen3-8B-Base2026.06 | 14.9 | — | |
| Base ModelBackbone=Qwen3-14B-Base2026.03 | 14 | — | |
| INFUSERModel Backbone=Qwen3-8B-Base2026.06 | 13.04 | — | |
| WISTBackbone=Qwen3-8B-Base2026.03 | 12.9 | — | |
| D2EvoBackbone=Llama-3.1-8B, #Data=1.2K, Iteration=32026.05 | 12.55 | — | |
| SPICEBackbone=Qwen3-4B-Base, Methodology=SPICE, Supervision Ratio=None2025.12 | 12.3 | — | |
| R-Few (5%)Backbone=Qwen3-8B-Base, Methodology=R-Few, Supervision Ratio=5%2025.12 | 12.3 | — | |
| + SPICEBackbone=Qwen3-4B-Base, #Data=20K2026.05 | 12.3 | — | |
| SPICEModel Backbone=Qwen3-4B-Base2026.06 | 12.3 | — | |
| R-FewModel Backbone=Qwen3-8B-Base2026.06 | 12.3 | — | |
| General-ReasonerBackbone=Qwen3-4B-Base, Methodology=General-Reasoner, Supervision Ratio=232k WebInstruct2025.12 | 12.2 | — | |
| + R-ZeroBackbone=Qwen3-8B-Base2026.05 | 12.19 | — | |
| R-ZeroModel Backbone=Qwen3-8B-Base2026.06 | 11.93 | — | |
| CoT Cold-StartModel=Qwen3-4B-Base2025.11 | 11.86 | — | |
| R-Few (5%)Backbone=Qwen3-4B-Base, Methodology=R-Few, Supervision Ratio=5%2025.12 | 11.8 | — | |
| R-Few (1%)Backbone=Qwen3-8B-Base, Methodology=R-Few, Supervision Ratio=1%2025.12 | 11.8 | — | |
| SPICEBackbone=Qwen3-4B-Base2026.03 | 11.8 | — | |
| WISTBackbone=Qwen3-4B-Base2026.03 | 11.8 | — | |
| R-FewModel Backbone=Qwen3-4B-Base2026.06 | 11.8 | — | |
| D2EvoBackbone=Qwen3-8B-Base, #Data=1.7K, Iteration=32026.05 | 11.75 | — | |
| + Full DataBackbone=Llama-3.1-8B, #Data=19K2026.05 | 11.75 | — | |
| Self-Instruct + Solver FeedbackModel=Qwen3-4B-Base2025.11 | 11.68 | — | |
| SPICEBackbone=Qwen3-8B-Base2026.03 | 11.6 | — | |
| + Full DataBackbone=Qwen3-8B-Base, #Data=19K2026.05 | 11.59 | — | |
| Self-Instruct + CoT-Self-InstructModel=Qwen3-4B-Base2025.11 | 11.5 | — | |
| CoT Cold-Start + Solver FeedbackModel=Qwen3-4B-Base2025.11 | 11.35 | — | |
| AZRModel Backbone=Qwen3-8B-Base2026.06 | 11.33 | — | |
| R-ZeroBackbone=Qwen3-8B-Base, Methodology=R-Zero, Supervision Ratio=None2025.12 | 11.3 | — | |
| Seed SetModel=Qwen3-4B-Base2025.11 | 11.22 | — | |
| INFUSERModel Backbone=Qwen3-4B-Base2026.06 | 11.22 | — | |
| R-Few (1%)Backbone=Qwen3-4B-Base, Methodology=R-Few, Supervision Ratio=1%2025.12 | 11.2 | — | |
| R-ZeroBackbone=Qwen3-8B-Base2026.03 | 11.2 | — | |
| Self-Instruct + R-ZeroModel=Qwen3-4B-Base2025.11 | 11.19 | — | |
| Self-InstructModel=Qwen3-4B-Base2025.11 | 11.13 | — | |
| Absolute ZeroBackbone=Qwen3-8B-Base, Methodology=Absolute Zero, Supervision Ratio=None2025.12 | 10.8 | — | |
| General-ReasonerBackbone=Qwen3-8B-Base, Methodology=General-Reasoner, Supervision Ratio=232k WebInstruct2025.12 | 10.8 | — | |
| + AZRBackbone=Qwen3-8B-Base2026.05 | 10.8 | — | |
| CoT Cold-Start + RLMTModel=Qwen3-4B-Base2025.11 | 10.75 | — | |
| Base ModelBackbone=Qwen3-8B-Base2026.05 | 10.75 | — | |
| D2EvoBackbone=Qwen3-4B-Base, #Data=1.4K, Iteration=32026.05 | 10.6 | — | |
| Base ModelBackbone=Qwen3-8B-Base, Methodology=Base, Supervision Ratio=None2025.12 | 10.5 | — | |
| R-ZeroBackbone=Qwen3-4B-Base, Methodology=R-Zero, Supervision Ratio=None2025.12 | 10.4 | — | |
| R-ZeroBackbone=Qwen3-4B-Base2026.03 | 10.4 | — | |
| SPICEBackbone=OctoThinker-8B-Hybrid-Base2026.03 | 10.4 | — | |
| + Full DataBackbone=Qwen3-4B-Base, #Data=19K2026.05 | 10.31 | — | |
| BaseModel Backbone=Qwen3-8B-Base2026.06 | 10.3 | — | |
| + R-ZeroBackbone=Qwen3-4B-Base2026.05 | 10.22 | — | |
| WISTBackbone=OctoThinker-8B-Hybrid-Base2026.03 | 10.1 | — | |
| R-ZeroModel Backbone=Qwen3-4B-Base2026.06 | 10.06 | — | |
| CoT Cold-Start + R-ZeroModel=Qwen3-4B-Base2025.11 | 9.93 | — | |
| R-ZeroBackbone=OctoThinker-8B-Hybrid-Base2026.03 | 9.9 | — | |
| Base ModelBackbone=Qwen3-8B-Base2026.03 | 9.1 | — | |
| AZRModel Backbone=Qwen3-4B-Base2026.06 | 8.7 | — | |
| Absolute ZeroBackbone=Qwen3-4B-Base, Methodology=Absolute Zero, Supervision Ratio=None2025.12 | 8.3 | — | |
| + AZRBackbone=Qwen3-4B-Base2026.05 | 8.3 | — | |
| Base ModelBackbone=Qwen3-4B-Base2026.05 | 8.25 | — | |
| Base ModelBackbone=Llama-3.1-8B2026.05 | 8.23 | — | |
| Base ModelBackbone=Qwen3-4B-Base2026.03 | 8.2 | — | |
| Base ModelBackbone=Qwen3-4B-Base, Methodology=Base, Supervision Ratio=None2025.12 | 8.1 | — | |
| Base ModelModel=Qwen3-4B-Base2025.11 | 7.57 | — | |
| BaseModel Backbone=Qwen3-4B-Base2026.06 | 7.57 | — | |
| Base ModelBackbone=OctoThinker-8B-Hybrid-Base2026.03 | 5.4 | — | |
| SPICEBackbone=OctoThinker-3B-Hybrid-Base2026.03 | 4.8 | — | |
| R-ZeroBackbone=OctoThinker-3B-Hybrid-Base2026.03 | 4.4 | — | |
| WISTBackbone=OctoThinker-3B-Hybrid-Base2026.03 | 4.1 | — | |
| Base ModelBackbone=OctoThinker-3B-Hybrid-Base2026.03 | 2.3 | — | |
| Claude3.7-SonnetModel Category=Closed-source Models2026.01 | — | 33.8 | |
| DeepSeek-R1Model Category=Closed-source Models2026.01 | — | 44.5 | |
| DeepSeek-R1-Distill-Qwen-32BModel Category=Open-source Models (32B), Parameter Count=32B, Model Variant=Distill2026.01 | — | 27.4 | |
| DeepSeek-R1-Distill-Qwen-7BModel Category=Open-source Models (7B), Parameter Count=7B, Model Variant=Distill2026.01 | — | 13.1 | |
| LoGos(32B)Model Category=Open-source Models (32B), Parameter Count=32B2026.01 | — | 34.1 | |
| LoGos(7B)Model Category=Open-source Models (7B), Parameter Count=7B2026.01 | — | 22.1 | |
| Qwen2.5-32B-BaseModel Category=Open-source Models (32B), Parameter Count=32B, Model Variant=Base2026.01 | — | 15.6 | |
| Qwen2.5-32B-InstructModel Category=Open-source Models (32B), Parameter Count=32B, Model Variant=Instruct2026.01 | — | 18 | |
| Qwen2.5-7B-BaseModel Category=Open-source Models (7B), Parameter Count=7B, Model Variant=Base2026.01 | — | 9.9 | |
| Qwen2.5-7B-InstructModel Category=Open-source Models (7B), Parameter Count=7B, Model Variant=Instruct2026.01 | — | 12.9 |