Natural Language Understanding on Open LLM Leaderboard (test)
57.94ARCIFD
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| IFDData size=3111 (6%), Training Dataset=Alpaca2024.02 | 57.94 | 80.37 | 44.19 | 40.62 | 55.78 | |
| RECOSTData size=5200 (10%), Training Dataset=Alpaca-gpt42024.02 | 57.68 | 80.63 | 48.53 | 52.11 | 59.74 | |
| Predictive EntropyData size=5200 (10%), Training Dataset=Alpaca-gpt42024.02 | 57.59 | 81.19 | 47.95 | 52.13 | 59.72 | |
| Full Alpaca-gpt4Data size=52002 (100%), Training Dataset=Alpaca-gpt42024.02 | 56.57 | 80.72 | 49.06 | 54.51 | 60.21 | |
| RECOSTData size=520 (1%), Training Dataset=Alpaca2024.02 | 56.48 | 77.73 | 45.8 | 44.27 | 56.07 | |
| RandomData size=5200 (10%), Training Dataset=Alpaca-gpt42024.02 | 55.63 | 80.87 | 48.52 | 51.27 | 59.07 | |
| LIMAData size=10002024.02 | 55.55 | 81.55 | 47.74 | 47.23 | 58.02 | |
| Predictive EntropyData size=520 (1%), Training Dataset=Alpaca2024.02 | 55.03 | 77.2 | 45.18 | 43.84 | 55.31 | |
| Llama-2-7B-star_instructBase Model=Llama-2-7B2024.11 | 54.44 | 77.64 | 46.94 | 46.13 | 56.29 | |
| Full AlpacaData size=52002 (100%), Training Dataset=Alpaca2024.02 | 54.18 | 78.21 | 45.8 | 42.05 | 55.06 | |
| RandomData size=520 (1%), Training Dataset=Alpaca2024.02 | 54.1 | 78.22 | 47.52 | 39.77 | 54.9 | |
| Llama-2-7B-evol_instructBase Model=Llama-2-7B2024.11 | 51.88 | 76.7 | 45.76 | 46.1 | 55.11 | |
| Wizardlm2024.11 | 51.6 | 77.74 | 42.74 | 45.75 | 54.18 |