Visual Document Reasoning on VDR
27.2AccuracyClaude-3.7-Sonnet
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude-3.7-SonnetEvaluation Setting=Agent Workflow2026.05 | 27.2 | |
| Qwen3-VL-30B + ODE-RLEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-RL2026.05 | 26.4 | |
| Qwen3-VL-30B + ODE-SFTEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-SFT2026.05 | 24 | |
| Qwen3-VL-8B + ODE-RLEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-RL2026.05 | 20.4 | |
| Qwen3-VL-8B + ODE-SFTEvaluation Setting=Visual-Native Agent Harness, Training Strategy=ODE-SFT2026.05 | 19.2 | |
| GPT-5Evaluation Setting=Agent Workflow2026.05 | 17.6 | |
| Claude-4-SonnetEvaluation Setting=Agent Workflow2026.05 | 13.6 | |
| Qwen3-VL-30BEvaluation Setting=Visual-Native Agent Harness2026.05 | 11 | |
| GPT-5Evaluation Setting=Direct Reasoning2026.05 | 10.8 | |
| Gemini-2.5 ProEvaluation Setting=Agent Workflow2026.05 | 10 | |
| Gemini-2.5 ProEvaluation Setting=Direct Reasoning2026.05 | 8 | |
| Gemini-2.5 FlashEvaluation Setting=Agent Workflow2026.05 | 7.8 | |
| Gemini-2.5 FlashEvaluation Setting=Direct Reasoning2026.05 | 6.2 | |
| Qwen3-VL-8BEvaluation Setting=Agent Workflow2026.05 | 5 | |
| Claude-3.7-SonnetEvaluation Setting=Direct Reasoning2026.05 | 4.6 | |
| Qwen3-VL-30BEvaluation Setting=Agent Workflow2026.05 | 4.4 | |
| Qwen3-VL-8BEvaluation Setting=Visual-Native Agent Harness2026.05 | 4.2 | |
| Qwen3-VL-30BEvaluation Setting=Direct Reasoning2026.05 | 3.8 | |
| Qwen3-VL-8BEvaluation Setting=Direct Reasoning2026.05 | 2.8 | |
| Claude-4-SonnetEvaluation Setting=Direct Reasoning2026.05 | 2 |