Role-playing on PersonaGym
4.98Engagement (EA)GPT-4o
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GPT-4oModel Version=gpt-4o-2024-11-20, Access=Close-source2025.12 | 4.98 | 4.96 | 4.41 | 4.96 | 4.97 | 4.85 | |
| Claude-3.7Model Version=claude-3-7-sonnet-20250219, Access=Close-source2025.12 | 4.9 | 4.97 | 4.5 | 4.9 | 4.82 | 4.82 | |
| MOA (GRPO)Backbone=Qwen3-8B-Base, Base RL Algorithm=GRPO2025.12 | 4.84 | 4.81 | 4.4 | 4.79 | 4.92 | 4.75 | |
| MOA (RLOO)Backbone=Qwen3-8B-Base, Base RL Algorithm=RLOO2025.12 | 4.71 | 4.82 | 4.31 | 4.71 | 4.89 | 4.69 | |
| SFTBackbone=Qwen3-8B-Base, Training=Supervised Fine-Tuning2025.12 | 4.67 | 4.7 | 4.18 | 4.71 | 4.67 | 4.58 | |
| RLOOBackbone=Qwen3-8B-Base, Training=Reinforcement Learning2025.12 | 4.62 | 4.76 | 4.21 | 4.68 | 4.81 | 4.62 | |
| GRPOBackbone=Qwen3-8B-Base, Training=Reinforcement Learning2025.12 | 4.17 | 4.84 | 3.95 | 4.61 | 4.14 | 4.34 |