Role-playing on RoleMRC
0.67KRMOA (GRPO)
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| MOA (GRPO)Backbone=Qwen3-8B-Base, Base RL Algorithm=GRPO2025.12 | 0.67 | 0.69 | 0.68 | 0.77 | 0.93 | 0.75 | |
| MOA (RLOO)Backbone=Qwen3-8B-Base, Base RL Algorithm=RLOO2025.12 | 0.65 | 0.5 | 0.6 | 0.7 | 0.94 | 0.68 | |
| RLOOBackbone=Qwen3-8B-Base, Training=Reinforcement Learning2025.12 | 0.58 | 0.42 | 0.55 | 0.66 | 0.94 | 0.63 | |
| GRPOBackbone=Qwen3-8B-Base, Training=Reinforcement Learning2025.12 | 0.51 | 0.33 | 0.49 | 0.69 | 0.92 | 0.59 | |
| Claude-3.7Model Version=claude-3-7-sonnet-20250219, Access=Close-source2025.12 | 0.5 | 0.86 | 0.69 | 0.43 | 0.47 | 0.59 | |
| SFTBackbone=Qwen3-8B-Base, Training=Supervised Fine-Tuning2025.12 | 0.49 | 0.33 | 0.51 | 0.66 | 0.88 | 0.57 | |
| GPT-4oModel Version=gpt-4o-2024-11-20, Access=Close-source2025.12 | 0.46 | 0.68 | 0.7 | 0.46 | 0.66 | 0.62 |