Ethical and Affective Alignment on Risk-stratified dataset
8.5787Respectful ToneETHICMIND_GPT-4o
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ETHICMIND_GPT-4oBackbone=GPT-4o, Average Response Length (Avg.Len.)=53.862026.04 | 8.5787 | 7.3069 | 7.3513 | 8.343 | 7.895 | |
| Llama-3.3-70BAverage Response Length (Avg.Len.)=55.992026.04 | 8.5379 | 6.8417 | 7.0833 | 8.262 | 7.6812 | |
| Emotional-llama-8BAverage Response Length (Avg.Len.)=76.622026.04 | 8.5265 | 6.3213 | 6.8633 | 6.8857 | 7.1492 | |
| GPT-4oAverage Response Length (Avg.Len.)=47.542026.04 | 8.4571 | 6.83 | 6.9864 | 8.1084 | 7.5955 | |
| ETHICMIND_Llama3.3-70BBackbone=Llama-3.3-70B, Average Response Length (Avg.Len.)=67.972026.04 | 8.4348 | 7.0329 | 7.4453 | 8.3566 | 7.8174 | |
| Llama-2-7b-chatAverage Response Length (Avg.Len.)=117.712026.04 | 8.311 | 7.2441 | 6.5221 | 7.6531 | 7.4326 | |
| ETHICMIND_Llama3-8BBackbone=Llama-3-8B-Instruct, Average Response Length (Avg.Len.)=62.762026.04 | 8.2399 | 6.6724 | 7.3094 | 7.9161 | 7.5344 | |
| Llama-3-8B-InstructAverage Response Length (Avg.Len.)=51.782026.04 | 8.2279 | 6.5646 | 6.8904 | 7.7893 | 7.368 | |
| COSMO-3BAverage Response Length (Avg.Len.)=25.082026.04 | 4.5548 | 4.3701 | 4.0119 | 5.2416 | 4.5446 |