Visual Policy Reasoning on ClevrPolicy-M N=6
85.15AccuracyTriMPI
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TriMPIStrategy=PoRo-DAPO2025.10 | 85.15 | 59.4 | |
| TriMPI w/ PoRo-DAPOModel Size=7B2025.10 | 85 | — | |
| TriMPI w/ PoRo-GRPOModel Size=7B2025.10 | 84.7 | — | |
| TriMPIStrategy=PoRo-GRPO2025.10 | 82.7 | 48.7 | |
| TriMPI w/ PoRo-DAPOModel Size=3B2025.10 | 82.35 | — | |
| TriMPI w/ PoRo-GRPOModel Size=3B2025.10 | 78.8 | — | |
| CoT SFT + DAPOModel Size=7B2025.10 | 74.4 | — | |
| CoT SFT + GRPOModel Size=7B2025.10 | 64.5 | — | |
| CoT SFT + DAPORL Algorithm=DAPO2025.10 | 37.6 | 41.6 | |
| CoT SFT + GRPORL Algorithm=GRPO2025.10 | 34 | 30.8 | |
| CoT SFT + DAPOModel Size=3B2025.10 | 33.25 | — | |
| CoT SFT2025.10 | 25.2 | 16.4 | |
| CoT SFT + GRPOModel Size=3B2025.10 | 22.4 | — | |
| Direct SFTModel Size=7B2025.10 | 14.55 | — | |
| CoT SFTModel Size=7B2025.10 | 14.3 | — | |
| Direct SFTModel Size=3B2025.10 | 12.9 | — | |
| CoT SFTModel Size=3B2025.10 | 9.25 | — | |
| In-Context2025.10 | 6.55 | 13.15 | |
| In-ContextModel Size=7B2025.10 | 5.65 | — | |
| Direct SFT2025.10 | 5.3 | 5.4 | |
| In-ContextModel Size=3B2025.10 | 4.55 | — |