Multimodal Conversation on PCogAlignBench (LS2)
0.852LLM Judge ScoreGRPO (Latent Action)
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=GRPO, Action Space=Latent Action2026.01 | 0.852 | |
| BNPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=BNPO, Action Space=Latent Action2026.01 | 0.852 | |
| GRPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=GRPO, Action Space=Token2026.01 | 0.851 | |
| Dr.GRPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=Dr.GRPO, Action Space=Latent Action2026.01 | 0.851 | |
| DAPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=DAPO, Action Space=Latent Action2026.01 | 0.85 | |
| GRPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=GRPO, Action Space=Token2026.01 | 0.845 | |
| Dr.GRPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=Dr.GRPO, Action Space=Latent Action2026.01 | 0.84 | |
| Dr.GRPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=Dr.GRPO, Action Space=Token2026.01 | 0.839 | |
| GRPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=GRPO, Action Space=Latent Action2026.01 | 0.837 | |
| BNPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=BNPO, Action Space=Token2026.01 | 0.836 | |
| BNPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=BNPO, Action Space=Latent Action2026.01 | 0.836 | |
| BNPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=BNPO, Action Space=Token2026.01 | 0.836 | |
| DAPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=DAPO, Action Space=Latent Action2026.01 | 0.835 | |
| Dr.GRPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=Dr.GRPO, Action Space=Token2026.01 | 0.834 | |
| DAPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=DAPO, Action Space=Token2026.01 | 0.828 | |
| DAPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=DAPO, Action Space=Token2026.01 | 0.828 | |
| SFTBackbone=Qwen2.5-VL-3B-Instruct, Training Method=SFT, Action Space=Token2026.01 | 0.81 | |
| SFTBackbone=Qwen2.5-VL-7B-Instruct, Training Method=SFT, Action Space=Token2026.01 | 0.799 | |
| PromptBackbone=Qwen2.5-VL-7B-Instruct, Training Method=Prompt, Action Space=Token2026.01 | 0.71 | |
| PromptBackbone=Qwen2.5-VL-3B-Instruct, Training Method=Prompt, Action Space=Token2026.01 | 0.676 |