Emotion assessment on EmoBench
74EA ScoreGemini-2.5-pro
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Gemini-2.5-proModel=Gemini-2.5-pro2026.03 | 74 | 62 | 68 | |
| Claude-3.5-sonnetModel=Claude-3.5-sonnet2026.03 | 73 | 54 | 63.5 | |
| DeepSeek-V3.2Model=DeepSeek-V3.22026.03 | 73 | 55 | 64 | |
| MAPOModel=Qwen3-32B2026.03 | 71 | 46 | 58.5 | |
| BaseModel=Qwen3-32B2026.03 | 70 | 43 | 56.5 | |
| GRPOModel=Qwen3-32B2026.03 | 70 | 44 | 57 | |
| MAPOModel=Qwen2.5-7B-instruct2026.03 | 70 | 39 | 54.5 | |
| MAPOModel=Qwen3-14B2026.03 | 69 | 42 | 55.5 | |
| BaseModel=Qwen2.5-7B-instruct2026.03 | 69 | 34 | 51.5 | |
| Qwen3-8B + PERMBackbone=Qwen3-8B, Enhancement=PERM2026.05 | 68.3 | 35.8 | — | |
| BaseModel=Qwen3-14B2026.03 | 68 | 38 | 53 | |
| GRPOModel=Qwen3-14B2026.03 | 68 | 37 | 52.5 | |
| GRPOModel=Qwen3-8B2026.03 | 68 | 32 | 50 | |
| MAPOModel=Qwen3-8B2026.03 | 68 | 38 | 53 | |
| GRPOModel=Qwen2.5-7B-instruct2026.03 | 68 | 33 | 50.5 | |
| Qwen3-8B + PereGRMBackbone=Qwen3-8B, Enhancement=PereGRM2026.05 | 67.4 | 39.1 | — | |
| Qwen3-8B + PereGRM@8Backbone=Qwen3-8B, Enhancement=PereGRM, Scaling factor (K)=82026.05 | 67.2 | 39.1 | — | |
| BaseModel=Qwen3-8B2026.03 | 67 | 31 | 49 | |
| Qwen3-8BBackbone=Qwen3-8B2026.05 | 66.3 | 35 | — |