Predicting Language Model Output on IMDB
0.0089Brier ScoreLAMP
Evaluation Results
| Method | Links | |
|---|---|---|
| LAMPBase Language Model=Mistral Large2025.05 | 0.0089 | |
| SHAPBase Language Model=Mistral Large2025.05 | 0.0103 | |
| SHAPBase Language Model=Claude 3.5 Haiku2025.05 | 0.0194 | |
| Mean baselineBase Language Model=Mistral Large2025.05 | 0.021 | |
| SHAPBase Language Model=GPT-4.1-mini2025.05 | 0.0262 | |
| LAMPBase Language Model=Gemini 2.5 Flash2025.05 | 0.0276 | |
| SHAPBase Language Model=Gemini 2.5 Flash2025.05 | 0.0292 | |
| LAMPBase Language Model=GPT-4.1-mini2025.05 | 0.0303 | |
| LAMPBase Language Model=Claude 3.5 Haiku2025.05 | 0.0428 | |
| ANCHORSBase Language Model=GPT-4.1-mini2025.05 | 0.0576 | |
| Mean baselineBase Language Model=Claude 3.5 Haiku2025.05 | 0.072 | |
| Uniform baselineBase Language Model=Claude 3.5 Haiku2025.05 | 0.1161 | |
| Mean baselineBase Language Model=GPT-4.1-mini2025.05 | 0.1201 | |
| Uniform baselineBase Language Model=Mistral Large2025.05 | 0.1673 | |
| Uniform baselineBase Language Model=GPT-4.1-mini2025.05 | 0.1732 | |
| ANCHORSBase Language Model=Mistral Large2025.05 | 0.1777 | |
| ANCHORSBase Language Model=Claude 3.5 Haiku2025.05 | 0.1869 | |
| Uniform baselineBase Language Model=Gemini 2.5 Flash2025.05 | 0.2281 | |
| Mean baselineBase Language Model=Gemini 2.5 Flash2025.05 | 0.3016 | |
| ANCHORSBase Language Model=Gemini 2.5 Flash2025.05 | 0.3225 | |
| LIMEBase Language Model=GPT-4.1-mini2025.05 | 0.3609 | |
| Random baselineBase Language Model=Claude 3.5 Haiku2025.05 | 0.3776 | |
| Random baselineBase Language Model=Mistral Large2025.05 | 0.4005 | |
| Random baselineBase Language Model=GPT-4.1-mini2025.05 | 0.4015 | |
| Random baselineBase Language Model=Gemini 2.5 Flash2025.05 | 0.4354 | |
| LIMEBase Language Model=Claude 3.5 Haiku2025.05 | 0.572 | |
| LIMEBase Language Model=Mistral Large2025.05 | 0.6165 | |
| LIMEBase Language Model=Gemini 2.5 Flash2025.05 | 0.721 |