Document Question Answering on DocVQA (Accuracy)
89.6AccuracySOFTSKILL-mean
Evaluation Results
| Method | Links | |
|---|---|---|
| SOFTSKILL-meanBase Model=Qwen3.5–4B, Insertion Placement=prompt start2026.06 | 89.6 | |
| SkillOptBase Model=Qwen3.5–4B2026.06 | 89 | |
| SOFTSKILLBase Model=Qwen3.5–4B, Insertion Placement=prompt start2026.06 | 88.2 | |
| LLM skillBase Model=Qwen3.5–4B2026.06 | 88 | |
| Trace2SkillBase Model=Qwen3.5–4B2026.06 | 88 | |
| Human skillBase Model=Qwen3.5–4B2026.06 | 87.8 | |
| LoRABase Model=Qwen3.5–4B2026.06 | 87.7 | |
| No skillBase Model=Qwen3.5–4B2026.06 | 86.9 | |
| TextGradBase Model=Qwen3.5–4B2026.06 | 85.6 | |
| GEPABase Model=Qwen3.5–4B2026.06 | 85.1 | |
| VGR-7BDownSample=2×2 | 2×2, #Vtoken=3024, LLM=Vicuna-7B2025.06 | 79.9 | |
| LLaVA-NeXT-7BDownSample=No, #Vtoken=2880, LLM=Vicuna-7B2025.06 | 77.4 | |
| VGR-7BDownSample=2×2 | 4×4, #Vtoken=864, LLM=Vicuna-7B2025.06 | 73.7 | |
| LLaVA-NeXT-7B†DownSample=2×2 | 4×4, #Vtoken=864, LLM=Vicuna-7B2025.06 | 70.2 | |
| Qwen-VL-Chat-7BDownSample=Cross-Attn, #Vtoken=1024, LLM=Qwen-7B2025.06 | 62.6 | |
| VRCDDecoding Length=384, Forward Ratio (FR)=0.252026.05 | 52.24 | |
| Visual CoTDownSample=No, #Vtoken=576, LLM=Vicuna-7B2025.06 | 49.3 | |
| VRCDDecoding Length=192, Forward Ratio (FR)=0.1252026.05 | 49.27 | |
| LLaVA-v1.5-7BDownSample=No, #Vtoken=576, LLM=Vicuna-7B2025.06 | 28.1 | |
| SOFTSKILL-mean-init-onlyBase Model=Qwen3.5–4B, Insertion Placement=prompt start2026.06 | 0 |