Recognizing Textual Entailment on RTE
26.24Delta 1Llama2-13B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Llama2-13Bscenario=original dataset2025.11 | 26.24 | 9.02 | |
| Llama2-13Bscenario=semantic dataset2025.11 | 22.63 | 2.15 | |
| Llama2-13Bscenario=updated dataset (ours)2025.11 | 21.12 | 1.1 | |
| Llama3-8Bscenario=original dataset2025.11 | 20.88 | 8.79 | |
| Yi1.5-6Bscenario=original dataset2025.11 | 19.64 | 8.8 | |
| Ministral-8Bscenario=original dataset2025.11 | 17.08 | 6.64 | |
| Mistral-12Bscenario=original dataset2025.11 | 13.43 | 7.49 | |
| Llama3-8Bscenario=semantic dataset2025.11 | 12.2 | 0.12 | |
| Yi1.5-6Bscenario=semantic dataset2025.11 | 11.16 | 0.36 | |
| Yi1.5-9Bscenario=original dataset2025.11 | 9.21 | 8.08 | |
| Qwen2.5-14Bscenario=original dataset2025.11 | 7.21 | 5.43 | |
| Qwen2.5-7Bscenario=original dataset2025.11 | 7.08 | 6.03 | |
| Yi1.5-6Bscenario=updated dataset (ours)2025.11 | 6.76 | 1.69 | |
| Ministral-8Bscenario=semantic dataset2025.11 | 6.5 | -0.72 | |
| Qwen2.5-14Bscenario=updated dataset (ours)2025.11 | 4.38 | 0 | |
| Llama3-8Bscenario=updated dataset (ours)2025.11 | 4.21 | 0.13 | |
| Ministral-8Bscenario=updated dataset (ours)2025.11 | 4.03 | -1.46 | |
| Mistral-12Bscenario=semantic dataset2025.11 | 2.74 | 0.11 | |
| Yi1.5-9Bscenario=semantic dataset2025.11 | 2.53 | 1.71 | |
| Qwen2.5-7Bscenario=updated dataset (ours)2025.11 | 2.31 | 1.08 | |
| Qwen2.5-7Bscenario=semantic dataset2025.11 | 1.74 | 0.72 | |
| Mistral-12Bscenario=updated dataset (ours)2025.11 | 1.45 | -0.62 | |
| Qwen2.5-14Bscenario=semantic dataset2025.11 | 0.52 | 0.12 | |
| Yi1.5-9Bscenario=updated dataset (ours)2025.11 | 0.45 | -0.37 |