Multi-modal Visualization Generation on MultiVis-Bench Iterative Refinement
66.67Low-Level Type ScoreLLM Workflow
Evaluation Results
| Method | Links | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| LLM WorkflowModel=gemini2026.01 | 66.67 | 68.84 | 38.41 | 71.01 | 78.26 | 83.33 | 67.75 | 89.86 | 88.33 | 78.8 | 80.25 | 72.28 | 89.86 | 81.62 | 74.69 | |
| MultiVis-AgentModel=gemini2026.01 | 63.04 | 49.28 | 36.96 | 70.29 | 78.26 | 76.81 | 62.44 | 87.86 | 87.54 | 81.52 | 73.19 | 72.64 | 92.39 | 80.6 | 71.52 | |
| LLM WorkflowModel=gpt2026.01 | 61.59 | 60.14 | 25.36 | 66.67 | 60.87 | 73.91 | 58.09 | 81.7 | 83.77 | 75.54 | 69.57 | 65.76 | 86.52 | 75.25 | 66.67 | |
| Instructing LLMModel=gemini2026.01 | 60.87 | 68.12 | 33.33 | 68.12 | 71.01 | 78.26 | 63.29 | 78.8 | 76.96 | 72.64 | 71.92 | 66.49 | 82.54 | 73.85 | 68.57 | |
| Instructing LLMModel=gpt2026.01 | 57.25 | 63.04 | 25.36 | 65.22 | 63.04 | 73.19 | 57.85 | 75.18 | 78.55 | 72.46 | 68.3 | 63.22 | 82.54 | 71.43 | 64.64 | |
| MultiVis-AgentModel=gpt2026.01 | 55.8 | 25.36 | 19.57 | 65.94 | 65.94 | 68.12 | 50.12 | 79.89 | 79.86 | 72.83 | 54.17 | 62.14 | 88.26 | 70.18 | 60.15 | |
| nvAgentModel=gpt2026.01 | 19.57 | 6.52 | 0 | 51.45 | 57.97 | 50.72 | 31.04 | 25.36 | 25.22 | 24.64 | 13.41 | 21.74 | 47.83 | 24.12 | 27.58 | |
| nvAgentModel=gemini2026.01 | 14.49 | 11.59 | 0 | 34.78 | 36.96 | 33.33 | 21.86 | 23.55 | 22.32 | 20.83 | 15.4 | 18.66 | 33.19 | 20.95 | 21.4 |