Reliability Assessment on Strategic probe sets
0.192Composite Reliability ScoreMICROPROBE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MICROPROBELanguage Model=GPT-2 Large2025.11 | 0.192 | 23.9 | 12.3 | |
| MICROPROBELanguage Model=DialoGPT2025.11 | 0.188 | 18.2 | 11.9 | |
| MICROPROBELanguage Model=GPT-22025.11 | 0.186 | 28.3 | 17.7 | |
| MICROPROBELanguage Model=GPT-2 Med2025.11 | 0.185 | 14.9 | 5.7 | |
| MICROPROBELanguage Model=Average2025.11 | 0.184 | 21.1 | 11.5 | |
| Active LearningLanguage Model=GPT-2 Med2025.11 | 0.175 | — | — | |
| Stratified SamplingLanguage Model=GPT-2 Med2025.11 | 0.172 | — | — | |
| Active LearningLanguage Model=GPT-2 Large2025.11 | 0.171 | — | — | |
| MICROPROBELanguage Model=DistilGPT-22025.11 | 0.171 | 23.9 | 12.5 | |
| Stratified SamplingLanguage Model=GPT-2 Large2025.11 | 0.168 | — | — | |
| Difficulty-BasedLanguage Model=GPT-2 Med2025.11 | 0.168 | — | — | |
| Active LearningLanguage Model=DialoGPT2025.11 | 0.168 | — | — | |
| Active LearningLanguage Model=Average2025.11 | 0.165 | — | — | |
| Stratified SamplingLanguage Model=DialoGPT2025.11 | 0.164 | — | — | |
| Stratified SamplingLanguage Model=Average2025.11 | 0.162 | — | — | |
| Difficulty-BasedLanguage Model=GPT-2 Large2025.11 | 0.162 | — | — | |
| Random SamplingLanguage Model=GPT-2 Med2025.11 | 0.161 | — | — | |
| Random SamplingLanguage Model=DialoGPT2025.11 | 0.159 | — | — | |
| Difficulty-BasedLanguage Model=DialoGPT2025.11 | 0.158 | — | — | |
| Active LearningLanguage Model=GPT-22025.11 | 0.158 | — | — | |
| Difficulty-BasedLanguage Model=Average2025.11 | 0.157 | — | — | |
| Random SamplingLanguage Model=GPT-2 Large2025.11 | 0.155 | — | — | |
| Stratified SamplingLanguage Model=GPT-22025.11 | 0.155 | — | — | |
| Random SamplingLanguage Model=Average2025.11 | 0.152 | — | — | |
| Active LearningLanguage Model=DistilGPT-22025.11 | 0.152 | — | — | |
| Difficulty-BasedLanguage Model=GPT-22025.11 | 0.151 | — | — | |
| Stratified SamplingLanguage Model=DistilGPT-22025.11 | 0.149 | — | — | |
| Random SamplingLanguage Model=GPT-22025.11 | 0.145 | — | — | |
| Difficulty-BasedLanguage Model=DistilGPT-22025.11 | 0.144 | — | — | |
| Random SamplingLanguage Model=DistilGPT-22025.11 | 0.138 | — | — |