Agentic Planning for Image Styling on Simple Vision-4B (test)
79.33Overall ScoreReward-Weighted (RW)
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Reward-Weighted (RW)Model Size=4B, Modality=Vision2026.03 | 79.33 | 75.04 | 83.95 | 83.26 | 81.86 | 78.06 | 73.88 | |
| GPT-4o (G4o)Backbone=GPT-4o, zero-shot=true2026.03 | 79.06 | 75.35 | 81.63 | 81.94 | 79.69 | 78.99 | 76.82 | |
| Standardized Reward-Weighted (SW)Model Size=4B, Modality=Vision2026.03 | 78.65 | 73.95 | 83.41 | 83.57 | 81.86 | 76.82 | 72.33 | |
| Reward (R)Model Size=4B, Modality=Vision2026.03 | 78.35 | 72.87 | 83.33 | 82.48 | 81.24 | 76.82 | 73.33 | |
| DPO (D)Model Size=4B, Modality=Vision2026.03 | 78.27 | 72.79 | 83.1 | 83.33 | 80.78 | 76.82 | 72.87 | |
| Edit-Only (E)Model Size=4B, Modality=Vision2026.03 | 78.04 | — | 81.47 | — | — | 75.5 | — | |
| Step-wise Reasoning (S)Model Size=4B, Modality=Vision2026.03 | 77.6 | 72.79 | 82.64 | 82.09 | 79.92 | 76.51 | 71.55 | |
| Baseline (B)Model Size=4B, Modality=Vision2026.03 | 77.28 | 72.17 | 82.64 | 82.33 | 79.92 | 75.19 | 71.47 |