Role-playing evaluation on MRBench English 1.0
9.13MA-SI ScoreDoubao-Seed-1.6-250615
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Doubao-Seed-1.6-250615Persona=MRPrompt2026.03 | 9.13 | 8.05 | 8.47 | 8.94 | 8.91 | 6.96 | 8.36 | 8.18 | |
| Qwen3-MaxPersona=MRPrompt2026.03 | 8.97 | 7.88 | 7.76 | 8.63 | 8.92 | 7.19 | 8.24 | 7.88 | |
| Qwen3-8BPersona=MRPrompt2026.03 | 8.97 | 7.76 | 7.56 | 8.64 | 8.88 | 6.92 | 8.13 | 7.83 | |
| DeepSeek-ChatPersona=MRPrompt2026.03 | 8.89 | 7.73 | 7.02 | 8.42 | 8.89 | 7.33 | 8.2 | 7.63 | |
| Qwen3-4BPersona=MRPrompt2026.03 | 8.88 | 7.69 | 7.61 | 8.69 | 8.85 | 6.84 | 8.07 | 7.73 | |
| GPT-5.2Persona=MRPrompt2026.03 | 8.87 | 7.73 | 8.14 | 8.66 | 8.92 | 7.47 | 8.21 | 7.85 | |
| GLM-4.7Persona=MRPrompt2026.03 | 8.83 | 7.75 | 7.98 | 8.67 | 8.89 | 7.12 | 8.2 | 7.71 | |
| GLM-4-9B-ChatPersona=MRPrompt2026.03 | 8.77 | 7.59 | 7.93 | 8.53 | 8.83 | 6.76 | 8.02 | 7.53 | |
| Llama-3.2-3B-InstructPersona=MRPrompt2026.03 | 8.73 | 7.5 | 7.69 | 8.45 | 8.87 | 7.1 | 8.04 | 7.55 | |
| Llama-3-8B-InstructPersona=MRPrompt2026.03 | 8.69 | 7.51 | 6.83 | 8.32 | 8.87 | 6.93 | 8.05 | 7.37 | |
| InternLM2.5-7B-ChatPersona=MRPrompt2026.03 | 8.08 | 7.31 | 7.89 | 8.4 | 8.75 | 6.71 | 7.71 | 7.13 | |
| Qwen3-0.6BPersona=MRPrompt2026.03 | 8.02 | 6.67 | 6.46 | 7.63 | 8.65 | 6.54 | 6.33 | 5.86 |