Multimodal Vision-Language Reasoning on Visual CoT benchmark
83.3DocV ScoreFoveateR7B
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| FoveateR7Binput image resolution=336^2, uses GT box=false, visual token count=322.5±162.72026.04 | 83.3 | 78.3 | 86.2 | 62.7 | 83.2 | 60 | 60.8 | 61.3 | 68.2 | 85.5 | 73.9 | 88.6 | |
| FoveateR3Binput image resolution=336^2, uses GT box=false, visual token count=307.0±156.02026.04 | 74 | 74 | 83 | 58.2 | 75.4 | 49 | 60.1 | 56.1 | 60.5 | 77.6 | 68.1 | 82.7 | |
| FoveateR7Binput image resolution=224^2, uses GT box=false, visual token count=253.8±162.72026.04 | 73.9 | 76.4 | 83.5 | 55.1 | 73.8 | 51.2 | 59.1 | 58.6 | 64.5 | 83.7 | 74.4 | 87.4 | |
| FoveateR3Binput image resolution=224^2, uses GT box=false, visual token count=242.3±168.72026.04 | 61.1 | 70 | 76.8 | 48.9 | 65.7 | 42.6 | 57.4 | 52.9 | 56.7 | 77.7 | 69.4 | 81.7 | |
| DocThink7Binput image resolution=336^2, uses GT box=true2026.04 | 57.9 | 68.2 | 80.2 | 40.8 | 49.5 | 34.7 | 67.4 | 58 | 54.6 | 54.2 | 65.6 | — | |
| VisCoT7B_multiinput image resolution=336^2, uses GT box=true, visual token count=1,152, visual focusing type=multi-pass2026.04 | 47.6 | 67.5 | 77.5 | 38.6 | 47 | 32.4 | 66.8 | 55.8 | 63.1 | 82.2 | 61.4 | 55.9 | |
| DocThink3Binput image resolution=336^2, uses GT box=true2026.04 | 46 | 66.3 | 74.6 | 21.3 | 48.6 | 35.5 | 66.4 | 57.2 | 48.6 | 48.5 | 62.5 | — | |
| VisCoT7B_multiinput image resolution=224^2, uses GT box=true, visual token count=1,152, visual focusing type=multi-pass2026.04 | 35.5 | 61 | 71.9 | 27.9 | 34.1 | 35.6 | 67.1 | 58 | 61.6 | 83.3 | 68.2 | 55.6 | |
| UV-CoT7B_multiinput image resolution=336^2, uses GT box=false, visual token count=1,152, visual focusing type=multi-pass2026.04 | 28.3 | — | 71.1 | 25.3 | 22.7 | 19.8 | 64.9 | 45.5 | 56.8 | — | 55.3 | — | |
| Llava1.513Binput image resolution=336^2, uses GT box=false, visual token count=5762026.04 | 26.8 | 61.5 | 61.7 | 28.7 | 16.4 | 42.6 | 62 | 58 | 57.1 | 41.3 | 59 | 57.3 | |
| Llava1.57Binput image resolution=336^2, uses GT box=false, visual token count=5762026.04 | 24.4 | 59.7 | 58.8 | 29 | 13.6 | 40 | 58.1 | 57.5 | 53.4 | 41.2 | 57.2 | 53 | |
| Sphinx13Binput image resolution=224^2, uses GT box=false, visual token count=17342026.04 | 19.8 | 55.1 | 53.2 | 0 | 7.1 | 35.2 | 60.7 | 55.8 | 58.4 | 46.7 | 61.3 | 50.5 | |
| VPT2B_textinput image resolution=224^2, uses GT box=true, visual token count=≥375, visual focusing type=text-grounded2026.04 | 12.5 | 53.7 | 46.6 | 10.3 | — | — | 68 | — | 60.6 | 84.2 | 65.7 | 89.2 |