Visual Question Answering on WSI-VQA
60.76Overall AccuracyOurs (SparseLearn)
Evaluation Results
| Method | Links | |
|---|---|---|
| Ours (SparseLearn)FLOPs=1.73T, Token pruning ratio=~ 60×, Evaluation Protocol=zero-shot2026.06 | 60.76 | |
| SlideChatInput=Slide2024.10 | 60.18 | |
| SlideChatFlops=133.3T, Status=Upper Bound2026.03 | 60.18 | |
| SlideChatFLOPs=133.3T, Constraint=Upper Bound2026.06 | 60.18 | |
| PathMemInput=WSI, Zero-shot=true2026.03 | 57.2 | |
| TC-SSAFlops=1.72T, Token Compression=~ 60×, Zero-shot=true2026.03 | 56.62 | |
| PathReasoner-R1-7BInput Type=Slide2026.01 | 55.9 | |
| SlideChat-7B (Baseline)Input Type=Slide2026.01 | 54.83 | |
| WSI-LLaVAInput=WSI, Zero-shot=true2026.03 | 54.6 | |
| MedDrInput=Patch2024.10 | 54.36 | |
| MedDrFlops=1.70T, Token Compression=~ 60×, Zero-shot=true2026.03 | 54.36 | |
| MedDrFLOPs=1.70T, Token pruning ratio=~ 60×, Evaluation Protocol=zero-shot2026.06 | 54.36 | |
| MedDrInput=Slide (T)2024.10 | 50.95 | |
| MedVLThinker-7BInput Type=Thumbnail2026.01 | 49.13 | |
| WSI-VQAInput=WSI, Zero-shot=true2026.03 | 46.9 | |
| PathReasoner-SFT-7BInput Type=Slide2026.01 | 46.36 | |
| Quilt-LLaVAInput=Patch2024.10 | 44.43 | |
| Quilt-LLaVAFlops=1.70T, Token Compression=~ 60×, Zero-shot=true2026.03 | 44.43 | |
| Quilt-LLaVAFLOPs=1.70T, Token pruning ratio=~ 60×, Evaluation Protocol=zero-shot2026.06 | 44.43 | |
| Patho-R1-7BInput Type=Thumbnail2026.01 | 44.28 | |
| HuatuoGPT-Vision-7BInput Type=Thumbnail2026.01 | 43.24 | |
| WSI-LLaVA-7BInput Type=Slide2026.01 | 42.05 | |
| MedGemma-4B-ITInput Type=Thumbnail2026.01 | 41.6 | |
| Qwen3-VL-8B-InstructInput Type=Thumbnail2026.01 | 39.92 | |
| InternVL3.5-8BInput Type=Thumbnail2026.01 | 39.62 | |
| Qwen3-VL-8B-ThinkingInput Type=Thumbnail2026.01 | 38.73 | |
| Quilt-LLaVA-7BInput Type=Thumbnail2026.01 | 38.14 | |
| Quilt-LLaVAInput=Slide (T)2024.10 | 35.4 | |
| Qwen2.5-VL-8B-InstructInput Type=Thumbnail2026.01 | 33.43 | |
| GPT-4oInput=Patch2024.10 | 30.41 | |
| GPT-4oToken Compression=~ 60×, Zero-shot=true2026.03 | 30.41 | |
| GPT-4oToken pruning ratio=~ 60×, Evaluation Protocol=zero-shot2026.06 | 30.41 | |
| LLaVA-Med-7BInput Type=Thumbnail2026.01 | 26.89 | |
| LLaVA-MedInput=Patch2024.10 | 26.31 | |
| LLaVA-MedFlops=1.70T, Token Compression=~ 60×, Zero-shot=true2026.03 | 26.31 | |
| LLaVA-MedFLOPs=1.70T, Token pruning ratio=~ 60×, Evaluation Protocol=zero-shot2026.06 | 26.31 | |
| RandomInput=Text2024.10 | 24.14 | |
| Random BaselineToken Compression=~ 60×, Zero-shot=true2026.03 | 24.14 | |
| Random BaselineToken pruning ratio=~ 60×2026.06 | 24.14 | |
| LLaVA-MedInput=Slide (T)2024.10 | 18.79 | |
| GPT-4Input=Text2024.10 | 18.6 | |
| GPT-4oInput=Slide (T)2024.10 | 14.03 | |
| Quilt-LLaVAInput=Thumb, Zero-shot=true2026.03 | 13.2 |