Visual Reasoning on TRACE (test)
0.346BLEU-1LTE-32B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LTE-32BModel Scale=32B2025.10 | 0.346 | 0.211 | 0.327 | |
| LTE-7BModel Scale=7B2025.10 | 0.314 | 0.209 | 0.291 | |
| Largest 4 Bboxes-32BModel Scale=32B, Input Sampling Strategy=Largest 4 Bboxes2025.10 | 0.303 | 0.182 | 0.158 | |
| Largest 3 Bboxes-32BModel Scale=32B, Input Sampling Strategy=Largest 3 Bboxes2025.10 | 0.299 | 0.183 | 0.147 | |
| E-32B (one-turn)Model Scale=32B, Interaction Mode=one-turn, Output Configuration=explanation-only2025.10 | 0.294 | 0.153 | 0.315 | |
| E+G-32B (one-turn)Model Scale=32B, Interaction Mode=one-turn, Output Configuration=explanation and grounding-only2025.10 | 0.282 | 0.149 | 0.295 | |
| E-7B (one-turn)Model Scale=7B, Interaction Mode=one-turn, Output Configuration=explanation-only2025.10 | 0.28 | 0.146 | 0.301 | |
| Dual Verdict Reward-32BModel Scale=32B, Training Configuration=Dual Verdict Reward2025.10 | 0.276 | 0.164 | 0.252 | |
| E+G-7B (one-turn)Model Scale=7B, Interaction Mode=one-turn, Output Configuration=explanation and grounding-only2025.10 | 0.275 | 0.136 | 0.269 | |
| No BLEU Reward-32BModel Scale=32B, Training Configuration=No BLEU Reward2025.10 | 0.187 | 0.095 | 0.153 | |
| SFT-32BModel Scale=32B, Training Stage=SFT2025.10 | 0.159 | 0.076 | 0.13 | |
| SFT-7BModel Scale=7B, Training Stage=SFT2025.10 | 0.156 | 0.042 | 0.129 | |
| Base-7BModel Scale=7B, Training Stage=Base (untrained)2025.10 | 0.11 | 0.032 | 0.073 | |
| Random Cropping-32BModel Scale=32B, Input Sampling Strategy=Random Cropping2025.10 | 0.105 | 0.043 | 0.109 | |
| Base-32BModel Scale=32B, Training Stage=Base (untrained)2025.10 | 0.102 | 0.043 | 0.079 | |
| LEGION2025.10 | 0.102 | 0.058 | 0.054 | |
| FakeShield2025.10 | 0.097 | 0.056 | 0.067 |