Emotional Intelligence Evaluation on EQ-Bench3
83.3Overall ScoreQwen3-8B + PereGRM@8
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Qwen3-8B + PereGRM@8Backbone=Qwen3-8B, Enhancement=PereGRM, Scaling factor (K)=82026.05 | 83.3 | — | — | — | — | — | — | — | |
| Qwen3-8B + PERMBackbone=Qwen3-8B, Enhancement=PERM2026.05 | 82.7 | — | — | — | — | — | — | — | |
| Qwen3-8B + PereGRMBackbone=Qwen3-8B, Enhancement=PereGRM2026.05 | 82.7 | — | — | — | — | — | — | — | |
| Qwen3-8BBackbone=Qwen3-8B2026.05 | 77.7 | — | — | — | — | — | — | — | |
| PERMBackbone=Qwen2.5-7B-Instruct, Category=RL Method2026.01 | 66.6 | 13.8 | 14 | 14.3 | 12.7 | 12.2 | 13.4 | 11.3 | |
| RMBackbone=Qwen2.5-7B-Instruct, Category=RL Method2026.01 | 62.3 | 12.7 | 12.9 | 13.4 | 11.6 | 11 | 12.2 | 10.8 | |
| RLVERBackbone=Qwen2.5-7B-Instruct, Category=RL Method, Feedback=Seeker perspective2026.01 | 61.8 | 12.4 | 12.9 | 13.3 | 11.5 | 10.5 | 12.4 | 10.7 | |
| Best-of-NBackbone=Qwen2.5-7B-Instruct, Category=Base Model2026.01 | 61.6 | 12.2 | 12.9 | 12.6 | 11 | 10.7 | 12 | 10 | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B-Instruct, Category=Base Model2026.01 | 60.1 | 12 | 12.4 | 12.6 | 10.4 | 10.2 | 11.4 | 10 | |
| PartnerBackbone=Qwen2.5-7B-Instruct, Category=RL Method, Feedback=Supporter perspective2026.01 | 59.7 | 12.1 | 12.5 | 12.4 | 11.2 | 10.7 | 11.7 | 9.7 | |
| SFT-GPTBackbone=Qwen2.5-7B-Instruct, Category=SFT Method, Supervision=GPT-generated responses2026.01 | 58.8 | 11.8 | 12.4 | 12.2 | 11.2 | 10.6 | 11.2 | 9.7 | |
| SFT-HumanBackbone=Qwen2.5-7B-Instruct, Category=SFT Method, Supervision=Human-written responses2026.01 | 38.2 | 7.5 | 8 | 6.1 | 5.4 | 4.5 | 4.9 | 4 |