Best-of-N scaling gain rank prediction on Math, Reasoning, and Code held-out prompts (LOO)
0.9Spearman CorrelationStable core + entropy add-on
Evaluation Results
| Method | Links | |
|---|---|---|
| Stable core + entropy add-onFeature set=Multi-feature predictors (compact ridge predictor)2026.06 | 0.9 | |
| Agreement-rate baselineFeature set=Multi-feature predictors2026.06 | 0.89 | |
| + Variance refinementsFeature set=Multi-feature predictors2026.06 | 0.89 | |
| Mean log-probabilityFeature set=Naive single-feature baselines2026.06 | 0.63 | |
| Mean reward-model scoreFeature set=Naive single-feature baselines2026.06 | 0.63 | |
| Agreement-rate featureFeature set=Naive single-feature baselines2026.06 | 0.62 | |
| Self-BLEUFeature set=Naive single-feature baselines2026.06 | 0.5 | |
| First-token entropyFeature set=Naive single-feature baselines2026.06 | 0.28 | |
| pass@1 aloneFeature set=Naive single-feature baselines2026.06 | 0.12 |