Dialogue Generation on Dialogue-level evaluation Ethical and Affective Alignment
8.1739Respectful ToneETHICMIND_GPT-4o
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| ETHICMIND_GPT-4oBackbone=GPT-4o, Framework=ETHICMIND, Evaluator=Claude2026.04 | 8.1739 | 6.9593 | 6.5084 | 7.2282 | 7.2174 | 53.86 | |
| GPT-4oBackbone=GPT-4o, Framework=Original, Evaluator=Claude2026.04 | 8.1275 | 6.6813 | 6.245 | 6.4662 | 6.88 | 47.54 | |
| Llama-3.3-70BBackbone=Llama-3.3-70B, Framework=Original, Evaluator=Claude2026.04 | 8.0872 | 6.6468 | 6.443 | 7 | 7.0442 | 55.99 | |
| ETHICMIND_Llama3.3-70BBackbone=Llama-3.3-70B, Framework=ETHICMIND, Evaluator=Claude2026.04 | 8.0638 | 6.6599 | 6.7013 | 7.278 | 7.1758 | 67.97 | |
| Llama-3-8B-InstructBackbone=Llama-3-8B-Instruct, Framework=Original, Evaluator=Claude2026.04 | 7.6611 | 5.6203 | 6.0839 | 6.2712 | 6.4091 | 51.78 | |
| ETHICMIND_Llama3-8BBackbone=Llama-3-8B-Instruct, Framework=ETHICMIND, Evaluator=Claude2026.04 | 7.6342 | 5.725 | 6.2752 | 6.3831 | 6.5044 | 62.76 | |
| Emotional-llama-8BBackbone=Emotional-llama-8B, Framework=Original, Evaluator=Claude2026.04 | 7.4966 | 5.3558 | 5.7349 | 4.9492 | 5.8841 | 76.62 | |
| Llama-2-7b-chatBackbone=Llama-2-7b-chat, Framework=Original, Evaluator=Claude2026.04 | 7.443 | 6.4727 | 5.396 | 5.413 | 6.1812 | 117.71 | |
| COSMO-3BBackbone=COSMO-3B, Framework=Original, Evaluator=Claude2026.04 | 4.4262 | 3.1343 | 3.1745 | 3.9696 | 3.6762 | 25.08 |