Correctness Prediction on Model-Query Evaluation (112 language models, 10 public benchmarks) (test)
70.12Accuracy (Prediction)IRT-NET
Evaluation Results
| Method | Links | |
|---|---|---|
| IRT-NETNumber of evaluation queries=10242026.01 | 70.12 | |
| LOCUSNumber of evaluation queries=10242026.01 | 70.03 | |
| EMBEDLLMNumber of evaluation queries=10242026.01 | 69.47 | |
| IRT-NETNumber of evaluation queries=5122026.01 | 69.07 | |
| LOCUSNumber of evaluation queries=5122026.01 | 68.33 | |
| LOCUSNumber of evaluation queries=2562026.01 | 68.31 | |
| EMBEDLLMNumber of evaluation queries=5122026.01 | 68.12 | |
| IRT-NETNumber of evaluation queries=2562026.01 | 67.38 | |
| EMBEDLLMNumber of evaluation queries=2562026.01 | 67.33 |