General Multi-task Language and Vision Understanding on 24-benchmark suite S3 text-friendly (test)
54Macro Avg ScoreLLM
Evaluation Results
| Method | Links | |
|---|---|---|
| LLMModel Scale=4B, Backbone=Qwen3 Instruct2026.05 | 54 | |
| Oracle-routedModel Scale=4B, Backbone=Qwen3 Instruct2026.05 | 54 | |
| Decision-routedModel Scale=4B, Backbone=Qwen3 Instruct2026.05 | 51.9 | |
| VLM + FoveationModel Scale=4B, Backbone=Qwen3 Instruct2026.05 | 44.8 | |
| VLMModel Scale=4B, Backbone=Qwen3 Instruct2026.05 | 44.6 |