Best-of-N scaling gain rank prediction on Math, Reasoning, and Code held-out prompts (LOSO)
0.9Spearman Correlation (ρ)Stable core + entropy add-on
Evaluation Results
| Method | Links | |
|---|---|---|
| Stable core + entropy add-onFeature set=Multi-feature predictors (compact ridge predictor)2026.06 | 0.9 | |
| + Variance refinementsFeature set=Multi-feature predictors2026.06 | 0.87 | |
| Agreement-rate baselineFeature set=Multi-feature predictors2026.06 | 0.83 | |
| Mean reward-model scoreFeature set=Naive single-feature baselines2026.06 | 0.57 | |
| Agreement-rate featureFeature set=Naive single-feature baselines2026.06 | 0.57 | |
| Mean log-probabilityFeature set=Naive single-feature baselines2026.06 | 0.56 | |
| Self-BLEUFeature set=Naive single-feature baselines2026.06 | 0.31 | |
| First-token entropyFeature set=Naive single-feature baselines2026.06 | 0.14 | |
| pass@1 aloneFeature set=Naive single-feature baselines2026.06 | -0.24 |