Multimodal Conversation on MMRole OOD
91.6LLM-as-a-Judge ScoreDr.GRPO (Latent Action)
Evaluation Results
| Method | Links | |
|---|---|---|
| Dr.GRPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=Dr.GRPO, Action Space=Latent Action2026.01 | 91.6 | |
| GRPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=GRPO, Action Space=Latent Action2026.01 | 91.5 | |
| BNPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=BNPO, Action Space=Latent Action2026.01 | 90.1 | |
| DAPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=DAPO, Action Space=Latent Action2026.01 | 88.9 | |
| GRPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=GRPO, Action Space=Latent Action2026.01 | 87.2 | |
| Dr.GRPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=Dr.GRPO, Action Space=Latent Action2026.01 | 86.4 | |
| DAPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=DAPO, Action Space=Latent Action2026.01 | 86.3 | |
| BNPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=BNPO, Action Space=Token2026.01 | 85.9 | |
| SFTBackbone=Qwen2.5-VL-7B-Instruct, Training Method=SFT, Action Space=Token2026.01 | 85.6 | |
| Dr.GRPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=Dr.GRPO, Action Space=Token2026.01 | 85.4 | |
| DAPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=DAPO, Action Space=Token2026.01 | 84.2 | |
| BNPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=BNPO, Action Space=Latent Action2026.01 | 84.2 | |
| GRPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=GRPO, Action Space=Token2026.01 | 84 | |
| Dr.GRPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=Dr.GRPO, Action Space=Token2026.01 | 82.3 | |
| PromptBackbone=Qwen2.5-VL-7B-Instruct, Training Method=Prompt, Action Space=Token2026.01 | 82.1 | |
| SFTBackbone=Qwen2.5-VL-3B-Instruct, Training Method=SFT, Action Space=Token2026.01 | 80.9 | |
| DAPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=DAPO, Action Space=Token2026.01 | 80.5 | |
| BNPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=BNPO, Action Space=Token2026.01 | 80.1 | |
| GRPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=GRPO, Action Space=Token2026.01 | 79.6 | |
| PromptBackbone=Qwen2.5-VL-3B-Instruct, Training Method=Prompt, Action Space=Token2026.01 | 68.7 |