Scientific Reasoning on GPQA main (Accuracy, Performance Gain)
69.64Accuracyl2-guided Selection
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| l2-guided SelectionModel=LLaMA-70B2026.06 | 69.64 | 4.08 | |
| l2-guided SelectionModel=Qwen3-32B2026.06 | 68.64 | 6.58 | |
| LLaMA-70BSetting=Recur2026.06 | 68.3 | 1.66 | |
| LLaMA-70BSetting=Base2026.06 | 67.19 | — | |
| Base (Mean@8)Model=LLaMA-70B2026.06 | 66.91 | — | |
| Qwen3-32BSetting=Recur2026.06 | 65.96 | 2.46 | |
| Base (Mean@8)Model=Qwen3-32B2026.06 | 64.4 | — | |
| Qwen3-32BSetting=Base2026.06 | 64.4 | — | |
| Qwen3-14BSetting=Recur2026.06 | 62.95 | 7.17 | |
| l2-guided SelectionModel=Qwen3-14B2026.06 | 60.04 | 2.13 | |
| Base (Mean@8)Model=Qwen3-14B2026.06 | 58.79 | — | |
| Qwen3-14BSetting=Base2026.06 | 58.71 | — | |
| Qwen3-8BSetting=Recur2026.06 | 57.37 | 4.86 | |
| l2-guided SelectionModel=Qwen3-8B2026.06 | 57.36 | 4.88 | |
| Base (Mean@8)Model=Qwen3-8B2026.06 | 54.69 | — | |
| Qwen3-8BSetting=Base2026.06 | 54.69 | — | |
| l2-guided SelectionModel=LLaMA-8B2026.06 | 54.68 | 8.38 | |
| LLaMA-8BSetting=Recur2026.06 | 52.23 | 3.63 | |
| Qwen3-4BSetting=Recur2026.06 | 51.55 | 2.66 | |
| Base (Mean@8)Model=LLaMA-8B2026.06 | 50.45 | — | |
| LLaMA-8BSetting=Base2026.06 | 50.45 | — | |
| l2-guided SelectionModel=Qwen3-4B2026.06 | 50.22 | 2.74 | |
| Qwen3-4BSetting=Base2026.06 | 50.22 | — | |
| Base (Mean@8)Model=Qwen3-4B2026.06 | 48.88 | — | |
| Qwen3-1.7BSetting=Recur2026.06 | 40.4 | 9.1 | |
| l2-guided SelectionModel=Qwen3-1.7B2026.06 | 39.96 | 7.85 | |
| Base (Mean@8)Model=Qwen3-1.7B2026.06 | 37.05 | — | |
| Qwen3-1.7BSetting=Base2026.06 | 37.05 | — |