Multimodal Conversation on MMRole (ID)
95.3LLM-as-a-Judge ScoreDr.GRPO (Latent Action)
Evaluation Results
| Method | Links | |
|---|---|---|
| Dr.GRPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=Dr.GRPO, Action Space=Latent Action2026.01 | 95.3 | |
| GRPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=GRPO, Action Space=Latent Action2026.01 | 94.9 | |
| DAPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=DAPO, Action Space=Latent Action2026.01 | 94.1 | |
| BNPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=BNPO, Action Space=Latent Action2026.01 | 94 | |
| GRPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=GRPO, Action Space=Latent Action2026.01 | 92 | |
| DAPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=DAPO, Action Space=Latent Action2026.01 | 92 | |
| Dr.GRPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=Dr.GRPO, Action Space=Latent Action2026.01 | 91.6 | |
| BNPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=BNPO, Action Space=Latent Action2026.01 | 91.6 | |
| BNPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=BNPO, Action Space=Token2026.01 | 89.4 | |
| GRPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=GRPO, Action Space=Token2026.01 | 89.2 | |
| Dr.GRPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=Dr.GRPO, Action Space=Token2026.01 | 89.2 | |
| DAPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=DAPO, Action Space=Token2026.01 | 89.2 | |
| SFTBackbone=Qwen2.5-VL-7B-Instruct, Training Method=SFT, Action Space=Token2026.01 | 88.5 | |
| Dr.GRPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=Dr.GRPO, Action Space=Token2026.01 | 86.7 | |
| BNPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=BNPO, Action Space=Token2026.01 | 86 | |
| DAPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=DAPO, Action Space=Token2026.01 | 85.6 | |
| SFTBackbone=Qwen2.5-VL-3B-Instruct, Training Method=SFT, Action Space=Token2026.01 | 84.3 | |
| PromptBackbone=Qwen2.5-VL-7B-Instruct, Training Method=Prompt, Action Space=Token2026.01 | 83.9 | |
| GRPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=GRPO, Action Space=Token2026.01 | 83.8 | |
| PromptBackbone=Qwen2.5-VL-3B-Instruct, Training Method=Prompt, Action Space=Token2026.01 | 72.8 |