Validating Response Generation on EmoValidBench English
89.3BERT ScoreLlama 3.1 8b
Evaluation Results
| Method | Links | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Llama 3.1 8bStrategy=LoRA2026.06 | 89.3 | 12.01 | 7.53 | 30.6 | 65.13 | 74.73 | 71.74 | 50.06 | 3.66 | 3.18 | 6.31 | 4.32 | 6.96 | 63.25 | |
| GPT 4.1 NanoStrategy=3-shot2026.06 | 88.53 | 13.32 | 4.59 | 22.88 | 60.71 | 75.52 | 67.75 | 47.61 | 5.68 | 5.06 | 6.95 | 5.77 | 6.99 | 74.62 | |
| Llama 3.1 8bStrategy=3-shot2026.06 | 88.45 | 13.17 | 4.51 | 24.93 | 62.01 | 76.73 | 67.59 | 48.2 | 6.05 | 5.52 | 6.97 | 5.99 | 6.99 | 67.12 | |
| Llama 3.1 8bStrategy=Zero-shot2026.06 | 88.36 | 13.2 | 4.35 | 23.94 | 62.37 | 76.11 | 68.73 | 48.15 | 5.34 | 4.75 | 6.86 | 5.39 | 6.98 | 61.33 | |
| GPT 4.1 NanoStrategy=Zero-shot2026.06 | 88.33 | 12.86 | 5.02 | 25.6 | 62.73 | 75.65 | 69.1 | 48.47 | 5.95 | 5.33 | 6.94 | 5.8 | 6.99 | 74.24 | |
| GPT 4.1 NanoStrategy=CoT2026.06 | 88.13 | 12.78 | 4.77 | 27.01 | 62.37 | 75.79 | 67.86 | 48.39 | 5.97 | 5.41 | 6.94 | 5.9 | 6.99 | 74.69 |