Predicting Language Model Output on PH
0.0073Brier ScoreLAMP
Evaluation Results
| Method | Links | |
|---|---|---|
| LAMPBase Language Model=Gemini 2.5 Flash2025.05 | 0.0073 | |
| LAMPBase Language Model=GPT-4.1-mini2025.05 | 0.0193 | |
| LAMPBase Language Model=Mistral Large2025.05 | 0.0209 | |
| SHAPBase Language Model=GPT-4.1-mini2025.05 | 0.0383 | |
| LAMPBase Language Model=Claude 3.5 Haiku2025.05 | 0.0759 | |
| Uniform baselineBase Language Model=Claude 3.5 Haiku2025.05 | 0.1167 | |
| SHAPBase Language Model=Mistral Large2025.05 | 0.1258 | |
| ANCHORSBase Language Model=Mistral Large2025.05 | 0.1406 | |
| Uniform baselineBase Language Model=GPT-4.1-mini2025.05 | 0.1421 | |
| Uniform baselineBase Language Model=Mistral Large2025.05 | 0.1471 | |
| ANCHORSBase Language Model=GPT-4.1-mini2025.05 | 0.148 | |
| SHAPBase Language Model=Claude 3.5 Haiku2025.05 | 0.1559 | |
| ANCHORSBase Language Model=Claude 3.5 Haiku2025.05 | 0.1702 | |
| ANCHORSBase Language Model=Gemini 2.5 Flash2025.05 | 0.1841 | |
| Mean baselineBase Language Model=GPT-4.1-mini2025.05 | 0.2025 | |
| Mean baselineBase Language Model=Claude 3.5 Haiku2025.05 | 0.2246 | |
| LIMEBase Language Model=Gemini 2.5 Flash2025.05 | 0.2417 | |
| SHAPBase Language Model=Gemini 2.5 Flash2025.05 | 0.2455 | |
| LIMEBase Language Model=Claude 3.5 Haiku2025.05 | 0.2625 | |
| Mean baselineBase Language Model=Mistral Large2025.05 | 0.2848 | |
| Mean baselineBase Language Model=Gemini 2.5 Flash2025.05 | 0.3646 | |
| Uniform baselineBase Language Model=Gemini 2.5 Flash2025.05 | 0.3646 | |
| LIMEBase Language Model=Mistral Large2025.05 | 0.3944 | |
| Random baselineBase Language Model=Claude 3.5 Haiku2025.05 | 0.414 | |
| Random baselineBase Language Model=GPT-4.1-mini2025.05 | 0.4194 | |
| LIMEBase Language Model=GPT-4.1-mini2025.05 | 0.4241 | |
| Random baselineBase Language Model=Mistral Large2025.05 | 0.427 | |
| Random baselineBase Language Model=Gemini 2.5 Flash2025.05 | 0.5227 |