Response Diversity on Role-playing dataset
68Distinct-2w/o RL
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| w/o RLBackbone=Qwen2.5-1.5B-Instruct2026.05 | 68 | 16 | 4.08 | 1.64 | |
| w/o RLBackbone=Qwen2.5-3B-Instruct2026.05 | 67 | 14 | 3.28 | 1.36 | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.05 | 64 | 12 | 1.98 | 0.91 | |
| GRPOBackbone=Qwen2.5-1.5B-Instruct2026.05 | 63 | 12 | 2.39 | 1.05 | |
| PPOBackbone=Qwen2.5-3B-Instruct2026.05 | 61 | 10 | 1.54 | 0.75 | |
| PPR-GDEBackbone=Qwen2.5-3B-Instruct2026.05 | 61 | 12 | 2.27 | 1 | |
| w/o RLBackbone=Qwen3-0.6B2026.05 | 60 | 14 | 3.53 | 1.42 | |
| PPOBackbone=Qwen2.5-1.5B-Instruct2026.05 | 55 | 10 | 1.97 | 0.87 | |
| PPR-GDEBackbone=Qwen2.5-1.5B-Instruct2026.05 | 55 | 14 | 3.02 | 1.24 | |
| PPR-GDEBackbone=Qwen3-0.6B2026.05 | 50 | 12 | 2.04 | 0.89 | |
| PPOBackbone=Qwen3-0.6B2026.05 | 47 | 9 | 1.6 | 0.72 | |
| GRPOBackbone=Qwen3-0.6B2026.05 | 20 | 8 | 1.39 | 0.56 |