Commonsense reasoning on HellaSwag 1.0 (test)
85.6AccuracyALUM-RoBERTa-Large
Evaluation Results
| Method | Links | |
|---|---|---|
| ALUM-RoBERTa-LargeBackbone=RoBERTa-Large, Training=Adversarial pre-training2020.04 | 85.6 | |
| RoBERTa-LargeBackbone=RoBERTa-Large2020.04 | 85.2 | |
| Mistral-7B + DSIRModel=Mistral-7B, Selection Method=DSIR, Protocol=10-shot2024.02 | 63.1 | |
| Mistral-7B BaseModel=Mistral-7B, Selection Method=Base, Protocol=10-shot2024.02 | 62.82 | |
| Mistral-7B + AutoDSModel=Mistral-7B, Selection Method=AutoDS, Protocol=10-shot2024.02 | 62.72 | |
| Mistral-7B + QuRatingModel=Mistral-7B, Selection Method=QuRating, Protocol=10-shot2024.02 | 62.64 | |
| Mistral-7B + UniformModel=Mistral-7B, Selection Method=Uniform, Protocol=10-shot2024.02 | 62.21 | |
| LLaMA2-7B BaseModel=LLaMA2-7B, Selection Method=Base, Protocol=10-shot2024.02 | 58.88 | |
| LLaMA2-7B + QuRatingModel=LLaMA2-7B, Selection Method=QuRating, Protocol=10-shot2024.02 | 58.79 | |
| LLaMA2-7B + UniformModel=LLaMA2-7B, Selection Method=Uniform, Protocol=10-shot2024.02 | 58.43 | |
| LLaMA2-7B + DSIRModel=LLaMA2-7B, Selection Method=DSIR, Protocol=10-shot2024.02 | 58.38 | |
| LLaMA2-7B + AutoDSModel=LLaMA2-7B, Selection Method=AutoDS, Protocol=10-shot2024.02 | 58.28 | |
| Gemma-2B + QuRatingModel=Gemma-2B, Selection Method=QuRating, Protocol=10-shot2024.02 | 53.1 | |
| Gemma-2B + DSIRModel=Gemma-2B, Selection Method=DSIR, Protocol=10-shot2024.02 | 52.95 | |
| Gemma-2B + UniformModel=Gemma-2B, Selection Method=Uniform, Protocol=10-shot2024.02 | 52.91 | |
| Gemma-2B + AutoDSModel=Gemma-2B, Selection Method=AutoDS, Protocol=10-shot2024.02 | 52.82 | |
| Gemma-2B BaseModel=Gemma-2B, Selection Method=Base, Protocol=10-shot2024.02 | 48.3 |