Open-Ended on PhyX mini (test)
2.7Overall AccuracyGRPO (Fmt + Acc)
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| GRPO (Fmt + Acc)Training=GRPO, Reward Configuration=Format + Accuracy, Backbone=Granite Vision 3.3 (2B)2026.04 | 2.7 | 2.4 | 7.1 | 2.4 | 0.6 | 1.2 | 2.4 | |
| GRPO (Fmt + Acc + ASM)Training=GRPO, Reward Configuration=Format + Accuracy + ASM, Backbone=Granite Vision 3.3 (2B)2026.04 | 2.2 | 1.2 | 5.9 | 2.4 | 1.2 | 0.6 | 1.8 | |
| GRPO (Rubric)Training=GRPO, Reward Configuration=Rubric, Backbone=Granite Vision 3.3 (2B)2026.04 | 1.8 | 1.2 | 1.8 | 1.2 | 1.2 | 1.8 | 3.6 | |
| GRPO (Fmt)Training=GRPO, Reward Configuration=Format, Backbone=Granite Vision 3.3 (2B)2026.04 | 1.7 | 2.4 | 2.4 | 1.2 | 1.8 | 0.6 | 1.8 | |
| GRPO (ASM)Training=GRPO, Reward Configuration=Attention Score Mask (ASM), Backbone=Granite Vision 3.3 (2B)2026.04 | 1.4 | 0.6 | 2.4 | 0.6 | 1.2 | 1.2 | 2.4 | |
| BaselineBackbone=Granite Vision 3.3 (2B)2026.04 | 1.2 | 1.8 | 1.8 | 0.6 | 0.6 | 1.2 | 1.2 | |
| SFTTraining=Supervised Fine-Tuning, Backbone=Granite Vision 3.3 (2B)2026.04 | 1.1 | 1.4 | 2 | 0.6 | 0.8 | 1 | 0.8 |