Multi-agent Cooperation on Group Guessing Game
73Trial 1 AccuracyQwen3-4B RL finetuned on HanabiRewards
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-4B RL finetuned on HanabiRewardsBackbone=Qwen3-4B, Variant=Ours-RL, Training=RL finetuned on HanabiRewards2026.01 | 73 | 71.5 | |
| Qwen3-4B-Instruct-2507Backbone=Qwen3-4B, Variant=Base2026.01 | 61 | 60.5 |