Large Model Performance Prediction on 285 models on one Math benchmark
100Top-10 RecallBrute-force Evaluation
Evaluation Results
| Method | Links | |
|---|---|---|
| Brute-force EvaluationEvaluation budget=100%2026.02 | 100 | |
| STAR-guided SelectionEvaluation budget=3.5%2026.02 | 82 | |
| Random SelectionEvaluation budget=75%2026.02 | 70 | |
| Random SelectionEvaluation budget=50%2026.02 | 52 | |
| Random SelectionEvaluation budget=25%2026.02 | 24 |