Emotional Intelligence Evaluation on EQ-Bench
86.4Overall ScoreGemini-2.5-pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-proModel=Gemini-2.5-pro2026.03 | 86.4 | |
| DeepSeek-V3.2Model=DeepSeek-V3.22026.03 | 84.9 | |
| Gemma-4-E4B-itActive / Total Parameters=4.0B / 8.0B, Sampling Settings=Recommended sampling settings, Judge=official judge, anthropic/claude-3.7-sonnet2026.05 | 80.2 | |
| Qwen3-4B-Thinking-2507Active / Total Parameters=4.0B / 4.0B, Sampling Settings=Recommended sampling settings, Judge=official judge, anthropic/claude-3.7-sonnet2026.05 | 79.6 | |
| Qwen3.5-4BActive / Total Parameters=4.0B / 4.0B, Sampling Settings=Recommended sampling settings, Judge=official judge, anthropic/claude-3.7-sonnet2026.05 | 79.5 | |
| Claude-3.5-sonnetModel=Claude-3.5-sonnet2026.03 | 77 | |
| MAPOModel=Qwen3-32B2026.03 | 75.8 | |
| GRPOModel=Qwen3-32B2026.03 | 74.4 | |
| MAPOModel=Qwen3-8B2026.03 | 74.1 | |
| BaseModel=Qwen3-32B2026.03 | 74 | |
| ZAYA1-8BActive / Total Parameters=0.7B / 8.0B, Sampling Settings=T=0.6, top-p=0.95, top-k=20, Judge=official judge, anthropic/claude-3.7-sonnet2026.05 | 73 | |
| MAPOModel=Qwen3-14B2026.03 | 71.7 | |
| GRPOModel=Qwen3-8B2026.03 | 71.4 | |
| BaseModel=Qwen3-8B2026.03 | 71.2 | |
| GRPOModel=Qwen3-14B2026.03 | 68.5 | |
| BaseModel=Qwen3-14B2026.03 | 68.2 | |
| MAPOModel=Qwen2.5-7B-instruct2026.03 | 56.4 | |
| BaseModel=Qwen2.5-7B-instruct2026.03 | 54.5 | |
| GRPOModel=Qwen2.5-7B-instruct2026.03 | 53.7 |