Multimodal Reasoning on VisAlg 1.0
48.23BLEUTwD
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| TwDcognitive_scaffold=Thinking with Drafting2026.02 | 48.23 | 72.22 | 68.29 | 11.97 | 93.68 | 30.25 | 0.9 | 0.96 | 0.7 | 0.73 | 1 | 85.91 | 82.63 | |
| Gemini-3-Provariant=Pro2026.02 | 30.18 | 59.06 | 57.53 | 18.23 | 90.36 | 27.32 | 0.97 | 0.95 | 0.94 | 0.78 | 0.96 | 91.98 | 79.96 | |
| Gemini-2.5-Provariant=Pro2026.02 | 28.94 | 58.25 | 57.43 | 18.12 | 89.97 | 26.92 | 0.95 | 0.76 | 0.99 | 0.73 | 0.32 | 74.97 | 74.12 | |
| Claude-42026.02 | 28.66 | 58.54 | 57.17 | 18.16 | 89.97 | 26.88 | 0.94 | 0.74 | 0.99 | 0.72 | 0.3 | 73.71 | 73.62 | |
| GPT-5.12026.02 | 22.93 | 56.13 | 51.23 | 25.86 | 86.89 | 25.7 | 0.77 | 0.67 | 0.95 | 0.51 | 0.19 | 61.69 | 66.6 | |
| GPT-4o2026.02 | 16.24 | 50.64 | 35.73 | 24.49 | 89.15 | 26.59 | 0.5 | 0.42 | 0.83 | 0.31 | 0.72 | 55.44 | 60.11 | |
| Mimo-VL-7B-RLparameters=7B, training=Reinforcement Learning2026.02 | 10.36 | 46.17 | 33.43 | 79.47 | 25.87 | 7.75 | 0.38 | 0.48 | 0.76 | 0.23 | 0.85 | 54.05 | 37.78 | |
| InternVL3-8Bparameters=8B2026.02 | 9.93 | 48.51 | 37.57 | 32.64 | 82.7 | 24.25 | 0.31 | 0.56 | 0.32 | 0.15 | 0.89 | 44.69 | 54.99 | |
| InternVL2.5-8Bparameters=8B2026.02 | 9.12 | 46.38 | 48.41 | 51.1 | 58.97 | 17.22 | 0.32 | 0.44 | 0.36 | 0.14 | 0.68 | 38.73 | 48.7 | |
| Intern-S1-minimodel_size=mini2026.02 | 8.41 | 36.47 | 22.68 | 59.52 | 49.32 | 14.65 | 0.57 | 0.26 | 0.87 | 0.36 | 0.97 | 60.39 | 44.13 | |
| Qwen3-VL-8Bparameters=8B2026.02 | 6.65 | 39.04 | 23.94 | 83.69 | 20.1 | 0 | 0.6 | 0.16 | 0.84 | 0.29 | 1 | 57.8 | 33.95 |