Science Question Answering on ScienceQA (Accuracy)
96.33AccuracyUDS
Evaluation Results
| Method | Links | |
|---|---|---|
| UDSModel=Qwen-2.5-14B, Full Finetuning=true2025.10 | 96.33 | |
| RegularModel=Qwen-2.5-14B, Full Finetuning=true2025.10 | 95.86 | |
| UDSModel=Qwen-2.5-7B-Instruct, Tuning Mode=Instruction Tuning2025.10 | 95.56 | |
| GREATSModel=Qwen-2.5-14B, Full Finetuning=true2025.10 | 95.54 | |
| RHO-LossModel=Qwen-2.5-14B, Full Finetuning=true2025.10 | 95.25 | |
| GREATSModel=Qwen-2.5-7B-Instruct, Tuning Mode=Instruction Tuning2025.10 | 95.22 | |
| RHO-LossModel=Qwen-2.5-7B-Instruct, Tuning Mode=Instruction Tuning2025.10 | 95.14 | |
| MaxGradModel=Qwen-2.5-14B, Full Finetuning=true2025.10 | 95.12 | |
| UDSModel=Qwen-2.5-7B, Full Finetuning=true2025.10 | 95.06 | |
| MaxLossModel=Qwen-2.5-7B-Instruct, Tuning Mode=Instruction Tuning2025.10 | 94.92 | |
| RandomModel=Qwen-2.5-14B, Full Finetuning=true2025.10 | 94.91 | |
| MaxLossModel=Qwen-2.5-14B, Full Finetuning=true2025.10 | 94.85 | |
| GREATSModel=Qwen-2.5-7B, Full Finetuning=true2025.10 | 94.75 | |
| RHO-LossModel=Qwen-2.5-7B, Full Finetuning=true2025.10 | 94.64 | |
| RandomModel=Qwen-2.5-7B-Instruct, Tuning Mode=Instruction Tuning2025.10 | 94.6 | |
| RegularModel=Qwen-2.5-7B, Full Finetuning=true2025.10 | 94.52 | |
| RegularModel=Qwen-2.5-7B-Instruct, Tuning Mode=Instruction Tuning2025.10 | 94.47 | |
| MaxGradModel=Qwen-2.5-7B-Instruct, Tuning Mode=Instruction Tuning2025.10 | 94.46 | |
| MaxLossModel=Qwen-2.5-7B, Full Finetuning=true2025.10 | 94.41 | |
| RandomModel=Qwen-2.5-7B, Full Finetuning=true2025.10 | 94.38 | |
| MaxGradModel=Qwen-2.5-7B, Full Finetuning=true2025.10 | 94.27 | |
| PRISM-QwenModel Size=7B, Backbone=Qwen, Training Strategy=Instruct2025.02 | 82.3 | |
| PRISM-QwenModel Size=7B, Backbone=Qwen, Training Strategy=Base2025.02 | 81.2 | |
| LLaVA-QwenModel Size=7B, Backbone=Qwen, Training Strategy=Instruct2025.02 | 80.2 | |
| PRISMModel Size=8B, Backbone=Llama2025.02 | 79.4 | |
| LLaVA-QwenModel Size=7B, Backbone=Qwen, Training Strategy=Base2025.02 | 79.1 | |
| LLaVA-LlamaModel Size=8B, Backbone=Llama2025.02 | 77.6 | |
| PRISMModel Size=3B, Backbone=Phi22025.02 | 76.3 | |
| LLaVA-Phi2Model Size=3B, Backbone=Phi22025.02 | 75.3 | |
| PRISMModel Size=13B, Backbone=Vicuna2025.02 | 74.5 | |
| LLaVA-VicunaModel Size=13B, Backbone=Vicuna2025.02 | 74.4 | |
| PRISMModel Size=7B, Backbone=Vicuna2025.02 | 71.3 | |
| VanillaVisual Token Budget=2880, Token Retention Ratio=100%2026.06 | 70.1 | |
| LLaVA-VicunaModel Size=7B, Backbone=Vicuna2025.02 | 69.4 | |
| PriorTRVisual Token Budget=320, Token Retention Ratio=11.1%2026.06 | 68.1 | |
| PDropVisual Token Budget=320, Token Retention Ratio=11.1%2026.06 | 67.5 | |
| PruMergeVisual Token Budget=320, Token Retention Ratio=11.1%2026.06 | 66.4 | |
| SparseVLMVisual Token Budget=320, Token Retention Ratio=11.1%2026.06 | 66.1 | |
| FastVVisual Token Budget=320, Token Retention Ratio=11.1%2026.06 | 62.8 |