Validating Response Generation on EmoValidBench Multilingual
89.29BERT ScoreLlama 3.1 8b
Evaluation Results
| Method | Links | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Llama 3.1 8bStrategy=LoRA2026.06 | 89.29 | 15.2 | 12.05 | 30.6 | 59.52 | 65.36 | 64.43 | 48.06 | 4.45 | 5.21 | 6.69 | 5.3 | 7 | 69.55 | |
| GPT 4.1 NanoStrategy=3-shot2026.06 | 89.26 | 16.24 | 4.58 | 21.42 | 52.32 | 72.29 | 68.76 | 46.41 | 5.05 | 5.57 | 6.9 | 5.68 | 7 | 73.57 | |
| Llama 3.1 8bStrategy=3-shot2026.06 | 89.03 | 15.94 | 5.52 | 25.97 | 54.66 | 71.54 | 69.59 | 47.61 | 4.42 | 5.06 | 6.65 | 4.96 | 7 | 68.96 | |
| GPT 4.1 NanoStrategy=Zero-shot2026.06 | 88.87 | 13.47 | 4.8 | 22.37 | 51.95 | 73.17 | 69.97 | 46.37 | 4.96 | 5.22 | 6.73 | 5.41 | 7 | 71.69 | |
| Llama 3.1 8bStrategy=Zero-shot2026.06 | 88.67 | 15.46 | 4.88 | 23.96 | 52.9 | 70.94 | 67.14 | 46.28 | 4.02 | 4.9 | 6.11 | 4.68 | 7 | 65.98 | |
| GPT 4.1 NanoStrategy=CoT2026.06 | 88.13 | 17.71 | 4.83 | 24.53 | 50.72 | 73.3 | 71.21 | 47.21 | 5.12 | 5.68 | 6.92 | 5.86 | 7 | 75.1 |