Complex Reasoning on BBH (Accuracy and Performance Gain)
89.14Accuracy (%)l2-guided Selection
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| l2-guided SelectionModel=Qwen3-32B2026.06 | 89.14 | 3.9 | |
| l2-guided SelectionModel=Qwen3-14B2026.06 | 88.95 | 4.24 | |
| Qwen3-32BSetting=Recur2026.06 | 88.11 | 2.75 | |
| Qwen3-14BSetting=Recur2026.06 | 88.01 | 3.17 | |
| Qwen3-8BSetting=Recur2026.06 | 87.41 | 3.26 | |
| Qwen3-4BSetting=Recur2026.06 | 87.39 | 3.1 | |
| l2-guided SelectionModel=Qwen3-8B2026.06 | 87.3 | 3.11 | |
| l2-guided SelectionModel=Qwen3-4B2026.06 | 87.2 | 2.85 | |
| LLaMA-70BSetting=Recur2026.06 | 86.41 | 1.88 | |
| l2-guided SelectionModel=LLaMA-70B2026.06 | 85.92 | 1.31 | |
| Base (Mean@8)Model=Qwen3-32B2026.06 | 85.79 | — | |
| Qwen3-32BSetting=Base2026.06 | 85.79 | — | |
| Base (Mean@8)Model=Qwen3-14B2026.06 | 85.33 | — | |
| Qwen3-14BSetting=Base2026.06 | 85.33 | — | |
| Base (Mean@8)Model=LLaMA-70B2026.06 | 84.81 | — | |
| LLaMA-70BSetting=Base2026.06 | 84.81 | — | |
| Base (Mean@8)Model=Qwen3-4B2026.06 | 84.78 | — | |
| Qwen3-4BSetting=Base2026.06 | 84.78 | — | |
| Base (Mean@8)Model=Qwen3-8B2026.06 | 84.67 | — | |
| Qwen3-8BSetting=Base2026.06 | 84.67 | — | |
| l2-guided SelectionModel=Qwen3-1.7B2026.06 | 76.75 | 5.38 | |
| Qwen3-1.7BSetting=Recur2026.06 | 74.57 | 2.41 | |
| l2-guided SelectionModel=LLaMA-8B2026.06 | 74.14 | 5.19 | |
| Base (Mean@8)Model=Qwen3-1.7B2026.06 | 72.83 | — | |
| Qwen3-1.7BSetting=Base2026.06 | 72.83 | — | |
| LLaMA-8BSetting=Recur2026.06 | 72.53 | 2.9 | |
| Base (Mean@8)Model=LLaMA-8B2026.06 | 70.48 | — | |
| LLaMA-8BSetting=Base2026.06 | 70.48 | — |