General Reasoning on SuperGPQA (Accuracy)
37.77Accuracy (General Reasoning)INFUSER
Evaluation Results
| Method | Links | |
|---|---|---|
| INFUSERModel Backbone=Qwen3-8B-Base2026.06 | 37.77 | |
| + SPICEBackbone=Qwen3-8B-Base, #Data=20K2026.05 | 35.7 | |
| SPICEModel Backbone=Qwen3-8B-Base2026.06 | 35.7 | |
| D2EvoBackbone=Qwen3-8B-Base, #Data=1.7K, Iteration=32026.05 | 33.71 | |
| + AZRBackbone=Qwen3-8B-Base2026.05 | 33.5 | |
| R-FewModel Backbone=Qwen3-8B-Base2026.06 | 33.5 | |
| INFUSERModel Backbone=Qwen3-4B-Base2026.06 | 33.48 | |
| + Full DataBackbone=Qwen3-8B-Base, #Data=19K2026.05 | 32.84 | |
| AZRModel Backbone=Qwen3-8B-Base2026.06 | 32.63 | |
| + R-ZeroBackbone=Qwen3-8B-Base2026.05 | 32.1 | |
| R-ZeroModel Backbone=Qwen3-8B-Base2026.06 | 32.06 | |
| Base ModelBackbone=Qwen3-8B-Base2026.05 | 31.06 | |
| BaseModel Backbone=Qwen3-8B-Base2026.06 | 30.62 | |
| + SPICEBackbone=Qwen3-4B-Base, #Data=20K2026.05 | 30.2 | |
| SPICEModel Backbone=Qwen3-4B-Base2026.06 | 30.2 | |
| + Full DataBackbone=Qwen3-4B-Base, #Data=19K2026.05 | 29.6 | |
| D2EvoBackbone=Qwen3-4B-Base, #Data=1.4K, Iteration=32026.05 | 29.51 | |
| R-FewModel Backbone=Qwen3-4B-Base2026.06 | 29.4 | |
| R-ZeroModel Backbone=Qwen3-4B-Base2026.06 | 28.4 | |
| AZRModel Backbone=Qwen3-4B-Base2026.06 | 28.31 | |
| + R-ZeroBackbone=Qwen3-4B-Base2026.05 | 27.96 | |
| + AZRBackbone=Qwen3-4B-Base2026.05 | 27.1 | |
| BaseModel Backbone=Qwen3-4B-Base2026.06 | 25.88 | |
| Base ModelBackbone=Qwen3-4B-Base2026.05 | 25.23 | |
| D2EvoBackbone=Llama-3.1-8B, #Data=1.2K, Iteration=32026.05 | 25.18 | |
| + Full DataBackbone=Llama-3.1-8B, #Data=19K2026.05 | 24.53 | |
| Base ModelBackbone=Llama-3.1-8B2026.05 | 22.35 |