Multimodal Reasoning on Multiple Evaluation Benchmarks Aggregate (test)
105.2Relative Average PerformanceGRACE
Evaluation Results
| Method | Links | |
|---|---|---|
| GRACEData selection ratio=15%, Backbone=Qwen3-VL-2B2026.05 | 105.2 | |
| GRACEData selection ratio=10%, Backbone=Qwen3-VL-2B2026.05 | 103.2 | |
| ICONSData selection ratio=10%, Backbone=Qwen3-VL-2B2026.05 | 102.4 | |
| ICONSData selection ratio=15%, Backbone=Qwen3-VL-2B2026.05 | 101.7 | |
| CADCData selection ratio=10%, Backbone=Qwen3-VL-2B2026.05 | 101.3 | |
| CADCData selection ratio=15%, Backbone=Qwen3-VL-2B2026.05 | 100.7 | |
| StepmaxData selection ratio=15%, Backbone=Qwen3-VL-2B2026.05 | 100.6 | |
| LongestData selection ratio=10%, Backbone=Qwen3-VL-2B2026.05 | 100.5 | |
| GRACEData selection ratio=5%, Backbone=Qwen3-VL-2B2026.05 | 100.2 | |
| FullData selection ratio=5%, Backbone=Qwen3-VL-2B2026.05 | 100 | |
| FullData selection ratio=10%, Backbone=Qwen3-VL-2B2026.05 | 100 | |
| FullData selection ratio=15%, Backbone=Qwen3-VL-2B2026.05 | 100 | |
| RandomData selection ratio=15%, Backbone=Qwen3-VL-2B2026.05 | 100 | |
| CADCData selection ratio=5%, Backbone=Qwen3-VL-2B2026.05 | 99.8 | |
| LESSData selection ratio=15%, Backbone=Qwen3-VL-2B2026.05 | 98.9 | |
| StepmaxData selection ratio=10%, Backbone=Qwen3-VL-2B2026.05 | 98.8 | |
| RandomData selection ratio=10%, Backbone=Qwen3-VL-2B2026.05 | 98.5 | |
| LongestData selection ratio=5%, Backbone=Qwen3-VL-2B2026.05 | 98.3 | |
| LongestData selection ratio=15%, Backbone=Qwen3-VL-2B2026.05 | 98.2 | |
| RandomData selection ratio=5%, Backbone=Qwen3-VL-2B2026.05 | 96.4 | |
| ICONSData selection ratio=5%, Backbone=Qwen3-VL-2B2026.05 | 95.9 | |
| StepmaxData selection ratio=5%, Backbone=Qwen3-VL-2B2026.05 | 95.6 | |
| LESSData selection ratio=10%, Backbone=Qwen3-VL-2B2026.05 | 95.5 | |
| LESSData selection ratio=5%, Backbone=Qwen3-VL-2B2026.05 | 90.4 |