Aggregate NLP Tasks on Average (Emotion, Irony, Stance, MRPC, RTE)
2.93Delta 1Qwen2.5-14B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-14Bscenario=updated dataset (ours)2025.11 | 2.93 | 0.7 | |
| Llama3-8Bscenario=updated dataset (ours)2025.11 | 4.38 | 1.29 | |
| Yi1.5-9Bscenario=updated dataset (ours)2025.11 | 5.74 | 0.59 | |
| Qwen2.5-7Bscenario=updated dataset (ours)2025.11 | 5.83 | 1.19 | |
| Qwen2.5-14Bscenario=semantic dataset2025.11 | 6.06 | 1.72 | |
| Ministral-8Bscenario=updated dataset (ours)2025.11 | 7.16 | 0.39 | |
| Mistral-12Bscenario=updated dataset (ours)2025.11 | 7.19 | 1.59 | |
| Qwen2.5-7Bscenario=semantic dataset2025.11 | 7.66 | 1.95 | |
| Yi1.5-6Bscenario=updated dataset (ours)2025.11 | 8.88 | 1.19 | |
| Llama3-8Bscenario=semantic dataset2025.11 | 10.62 | 2.09 | |
| Yi1.5-9Bscenario=semantic dataset2025.11 | 10.71 | 2.33 | |
| Qwen2.5-7Bscenario=original dataset2025.11 | 12.01 | 4.74 | |
| Mistral-12Bscenario=semantic dataset2025.11 | 12.61 | 2.36 | |
| Ministral-8Bscenario=semantic dataset2025.11 | 12.84 | 1.81 | |
| Yi1.5-6Bscenario=semantic dataset2025.11 | 13.6 | 1.49 | |
| Llama2-13Bscenario=updated dataset (ours)2025.11 | 16.27 | 1.01 | |
| Qwen2.5-14Bscenario=original dataset2025.11 | 17.45 | 7.19 | |
| Llama3-8Bscenario=original dataset2025.11 | 18.95 | 6.84 | |
| Llama2-13Bscenario=semantic dataset2025.11 | 20.92 | 2.38 | |
| Yi1.5-6Bscenario=original dataset2025.11 | 23.51 | 7.69 | |
| Ministral-8Bscenario=original dataset2025.11 | 25.17 | 7.7 | |
| Yi1.5-9Bscenario=original dataset2025.11 | 25.22 | 10.65 | |
| Mistral-12Bscenario=original dataset2025.11 | 26.5 | 8.86 | |
| Llama2-13Bscenario=original dataset2025.11 | 31.16 | 7.07 |