Multimodal Conversation on PCogAlignBench LS1
0.903LLM Judge ScoreDAPO (Latent Action)
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=DAPO, Action Space=Latent Action2026.01 | 0.903 | |
| BNPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=BNPO, Action Space=Latent Action2026.01 | 0.901 | |
| GRPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=GRPO, Action Space=Latent Action2026.01 | 0.898 | |
| Dr.GRPO (Latent Action)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=Dr.GRPO, Action Space=Latent Action2026.01 | 0.897 | |
| DAPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=DAPO, Action Space=Latent Action2026.01 | 0.879 | |
| Dr.GRPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=Dr.GRPO, Action Space=Latent Action2026.01 | 0.874 | |
| BNPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=BNPO, Action Space=Latent Action2026.01 | 0.872 | |
| GRPO (Latent Action)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=GRPO, Action Space=Latent Action2026.01 | 0.871 | |
| GRPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=GRPO, Action Space=Token2026.01 | 0.87 | |
| Dr.GRPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=Dr.GRPO, Action Space=Token2026.01 | 0.854 | |
| BNPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=BNPO, Action Space=Token2026.01 | 0.85 | |
| BNPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=BNPO, Action Space=Token2026.01 | 0.849 | |
| GRPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=GRPO, Action Space=Token2026.01 | 0.845 | |
| DAPO (Token)Backbone=Qwen2.5-VL-7B-Instruct, Training Method=DAPO, Action Space=Token2026.01 | 0.844 | |
| Dr.GRPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=Dr.GRPO, Action Space=Token2026.01 | 0.835 | |
| DAPO (Token)Backbone=Qwen2.5-VL-3B-Instruct, Training Method=DAPO, Action Space=Token2026.01 | 0.835 | |
| SFTBackbone=Qwen2.5-VL-3B-Instruct, Training Method=SFT, Action Space=Token2026.01 | 0.808 | |
| SFTBackbone=Qwen2.5-VL-7B-Instruct, Training Method=SFT, Action Space=Token2026.01 | 0.808 | |
| PromptBackbone=Qwen2.5-VL-7B-Instruct, Training Method=Prompt, Action Space=Token2026.01 | 0.721 | |
| PromptBackbone=Qwen2.5-VL-3B-Instruct, Training Method=Prompt, Action Space=Token2026.01 | 0.678 |