Role-playing evaluation on MRBench Chinese 1.0
8.85Memory Adherence (SI)Doubao-Seed-1.6-250615
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Doubao-Seed-1.6-250615Persona=MRPrompt2026.03 | 8.85 | 8.43 | 9.1 | 8.73 | 8.6 | 7.25 | 7.83 | 7.54 | |
| Qwen3-8BPersona=MRPrompt2026.03 | 8.73 | 8.25 | 8.99 | 8.56 | 8.52 | 7.07 | 7.64 | 7.42 | |
| GLM-4-9B-ChatPersona=MRPrompt2026.03 | 8.7 | 8.23 | 8.88 | 8.52 | 8.54 | 7.07 | 7.63 | 7.41 | |
| Qwen3-4BPersona=MRPrompt2026.03 | 8.61 | 8.23 | 8.81 | 8.57 | 8.56 | 6.99 | 7.63 | 7.41 | |
| GLM-4.7Persona=MRPrompt2026.03 | 8.38 | 8.38 | 9.03 | 8.46 | 8.65 | 6.99 | 7.71 | 7.36 | |
| DeepSeek-ChatPersona=MRPrompt2026.03 | 8.37 | 8.3 | 7.64 | 7.94 | 8.63 | 7.46 | 7.54 | 7.21 | |
| Llama-3-8B-InstructPersona=MRPrompt2026.03 | 8.2 | 7.68 | 8.63 | 8.03 | 8.47 | 7.13 | 7.2 | 6.69 | |
| GPT-5.2Persona=MRPrompt2026.03 | 8.18 | 8.2 | 9.04 | 8.43 | 8.66 | 7.35 | 7.55 | 7.21 | |
| Qwen3-MaxPersona=MRPrompt2026.03 | 8.12 | 8.34 | 8.36 | 8.13 | 8.69 | 7.26 | 7.61 | 7.2 | |
| Qwen3-0.6BPersona=MRPrompt2026.03 | 8.06 | 7.81 | 8.69 | 7.77 | 8.23 | 6.56 | 6.97 | 6.35 | |
| InternLM2.5-7B-ChatPersona=MRPrompt2026.03 | 7.99 | 7.98 | 9.1 | 8.33 | 8.46 | 6.92 | 7.36 | 6.95 | |
| Llama-3.2-3B-InstructPersona=MRPrompt2026.03 | 7.35 | 7.19 | 8.63 | 7.36 | 8.19 | 6.65 | 6.6 | 5.88 |