Image Classification on PCAM
95.9Top-1 AccCPath-CLIP
Evaluation Results
| Method | Links | |
|---|---|---|
| CPath-CLIPzero-shot=true2024.12 | 95.9 | |
| FLYPEvaluation Protocol=Fine-tuning2022.12 | 90.3 | |
| FTEvaluation Protocol=Fine-tuning2022.12 | 89.1 | |
| LP-FTEvaluation Protocol=Linear Probing then Fine-tuning2022.12 | 89 | |
| PathGen-CLIP-Lzero-shot=true2024.12 | 88.2 | |
| WUDI-Merging w/ E-PMQMerging Strategy=WUDI-Merging, Quantization Method=E-PMQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 86.57 | |
| WUDI-Merging + E-PMQMerging Strategy=WUDI-Merging, Quantization Method=E-PMQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 85.9 | |
| WUDI-MergingMerging Strategy=WUDI-Merging, Quantization Method=None, Model Backbone=CLIP-ViT-B/32, Bit-width=Full2026.05 | 85.5 | |
| FLAVALinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 85.3 | |
| WUDI-Merging w/ GPTQMerging Strategy=WUDI-Merging, Quantization Method=GPTQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 85.06 | |
| nCLIPLinear probing=true, Backbone=ViT-B/16, Pre-train=IT35M2022.10 | 84.2 | |
| BiomedCLIPzero-shot=true2024.12 | 84 | |
| DaVinciLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 83.6 | |
| xCLIPLinear probing=true, Backbone=ViT-B/16, Pre-train=IT35M2022.10 | 83.5 | |
| CLIPLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 83.5 | |
| CLIPLinear probing=true, Backbone=ViT-B/16, Pre-train=IT35M2022.10 | 83.4 | |
| LPEvaluation Protocol=Linear Probing2022.12 | 82.6 | |
| WUDI-Merging w/ RTNMerging Strategy=WUDI-Merging, Quantization Method=RTN, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 82.48 | |
| X-FM_baseLinear evaluation=true, Model size=Base, Patch size=16*16, Resolution=224*2242023.01 | 82.4 | |
| WUDI-MergingMerging Strategy=WUDI-Merging, Quantization Method=Full-precision, Bit-width=Full, Backbone=CLIP-ViT-B/322026.05 | 82 | |
| WUDI-Merging w/ AWQMerging Strategy=WUDI-Merging, Quantization Method=AWQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 80.97 | |
| ResNet-18Backbone=ResNet-182026.03 | 80.71 | |
| RoPEPositional Encoding=RoPE2026.03 | 79.82 | |
| Learnable PEPositional Encoding=Learnable2026.03 | 79.74 | |
| No PEPositional Encoding=None2026.03 | 79.65 | |
| WUDI-Merging + GPTQMerging Strategy=WUDI-Merging, Quantization Method=GPTQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 77.44 | |
| TIES-MergingMerging Strategy=TIES-Merging, Quantization Method=None, Model Backbone=CLIP-ViT-B/32, Bit-width=Full2026.05 | 77.1 | |
| Simple Averaging w/ E-PMQMerging Strategy=Simple Averaging, Quantization Method=E-PMQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 75.44 | |
| TIES-Merging w/ E-PMQMerging Strategy=TIES-Merging, Quantization Method=E-PMQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 74.39 | |
| Task Arithmetic w/ E-PMQMerging Strategy=Task Arithmetic, Quantization Method=E-PMQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 73.64 | |
| Simple Averaging + E-PMQMerging Strategy=Simple Averaging, Quantization Method=E-PMQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 73.57 | |
| TIES-Merging + E-PMQMerging Strategy=TIES-Merging, Quantization Method=E-PMQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 73.08 | |
| PathCLIPzero-shot=true2024.12 | 72.5 | |
| WUDI-Merging + RTNMerging Strategy=WUDI-Merging, Quantization Method=RTN, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 72.16 | |
| DFN5B-CLIP-H/14+Zero-shot=true2024.02 | 69.6 | |
| WUDI-Merging + AWQMerging Strategy=WUDI-Merging, Quantization Method=AWQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 67.75 | |
| Task Arithmetic + E-PMQMerging Strategy=Task Arithmetic, Quantization Method=E-PMQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 66.98 | |
| TIES-MergingMerging Strategy=TIES-Merging, Quantization Method=Full-precision, Bit-width=Full, Backbone=CLIP-ViT-B/322026.05 | 66.9 | |
| DFN5B-CLIP-H/14Zero-shot=true2024.02 | 65.2 | |
| EVA-CLIP-18BZero-shot=true2024.02 | 65.2 | |
| Simple AveragingMerging Strategy=Simple Averaging, Quantization Method=None, Model Backbone=CLIP-ViT-B/32, Bit-width=Full2026.05 | 65.2 | |
| EVA-02-CLIP-E/14+Zero-shot=true2024.02 | 64.4 | |
| Simple Averaging w/ GPTQMerging Strategy=Simple Averaging, Quantization Method=GPTQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 64.39 | |
| Task ArithmeticMerging Strategy=Task Arithmetic, Quantization Method=None, Model Backbone=CLIP-ViT-B/32, Bit-width=Full2026.05 | 64.1 | |
| Simple AveragingMerging Strategy=Simple Averaging, Quantization Method=Full-precision, Bit-width=Full, Backbone=CLIP-ViT-B/322026.05 | 63.9 | |
| OpenCLIP-G/14Zero-shot=true2024.02 | 63.6 | |
| CLIPBackbone=ViT-L/14-3362021.11 | 63 | |
| CLIPPre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 62.8 | |
| EVA-01-CLIP-g/14+Zero-shot=true2024.02 | 62.4 | |
| TinyCLIPImage Encoder=ViT-39M/16, Zero-shot=true2026.02 | 60.5 | |
| CLIPImage Encoder=ViT-B/16, Zero-shot=true2026.02 | 60.2 | |
| TIES-Merging w/ GPTQMerging Strategy=TIES-Merging, Quantization Method=GPTQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 59.66 | |
| BASIC-LBackbone=BASIC-L2021.11 | 59.6 | |
| ITO sub2Pre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 59.6 | |
| CLIP (reported)Pre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 58.8 | |
| QuiltNetzero-shot=true2024.12 | 58.7 | |
| BASIC-MBackbone=BASIC-M2021.11 | 58.3 | |
| Task Arithmetic w/ GPTQMerging Strategy=Task Arithmetic, Quantization Method=GPTQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 58.14 | |
| EVA-CLIP-8BZero-shot=true2024.02 | 58.1 | |
| Task Arithmetic w/ AWQMerging Strategy=Task Arithmetic, Quantization Method=AWQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 57.72 | |
| ITOPre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 57.7 | |
| Simple Averaging + GPTQMerging Strategy=Simple Averaging, Quantization Method=GPTQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 57.65 | |
| CLIPBackbone=ResNet-502021.11 | 57.6 | |
| TIES-Merging + GPTQMerging Strategy=TIES-Merging, Quantization Method=GPTQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 57.45 | |
| CLIP-MapsmallImage Encoder=ViT-8M/16, Zero-shot=true2026.02 | 57.4 | |
| FLAIRPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 57.2 | |
| ITO sub2Pre-training Dataset=DataComp-1B, Backbone=ViT-B/16, Training Epochs=10 epochs, Zero-shot protocol=EVA-CLIP2026.03 | 56.5 | |
| ZeroshotEvaluation Protocol=Zero-shot2022.12 | 56.49 | |
| CLIP-PGSImage Encoder=ViT-S/16, p=0.5, Protocol=Zero-shot2025.03 | 56.4 | |
| OpenCLIPImage Encoder=ViT-B/16, Zero-shot=true2026.02 | 56.4 | |
| SLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 55.9 | |
| CLIPPre-train dataset=CC3M, Backbone=ViT-B/16, Training Epochs=30, Evaluation Protocol=Zero-shot2026.03 | 55.6 | |
| OpenAI-CLIP-Lzero-shot=true2024.12 | 55.5 | |
| BASIC-SBackbone=BASIC-S2021.11 | 54.3 | |
| Task Arithmetic w/ RTNMerging Strategy=Task Arithmetic, Quantization Method=RTN, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 54.2 | |
| MLCDPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 53.7 | |
| Simple Averaging + AWQMerging Strategy=Simple Averaging, Quantization Method=AWQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 53.55 | |
| Simple Averaging w/ AWQMerging Strategy=Simple Averaging, Quantization Method=AWQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 53.3 | |
| Task ArithmeticMerging Strategy=Task Arithmetic, Quantization Method=Full-precision, Bit-width=Full, Backbone=CLIP-ViT-B/322026.05 | 53.2 | |
| †TinyCLIPImage Encoder=ViT-8M/16, Zero-shot=true2026.02 | 52.8 | |
| Task Arithmetic + AWQMerging Strategy=Task Arithmetic, Quantization Method=AWQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 52.62 | |
| TIES-Merging w/ RTNMerging Strategy=TIES-Merging, Quantization Method=RTN, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 52.49 | |
| Simple Averaging w/ RTNMerging Strategy=Simple Averaging, Quantization Method=RTN, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 52.38 | |
| TIES-Merging + AWQMerging Strategy=TIES-Merging, Quantization Method=AWQ, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 52.19 | |
| PLIPzero-shot=true2024.12 | 51.8 | |
| CLIP-MapbaseImage Encoder=ViT-39M/16, Zero-shot=true2026.02 | 51.7 | |
| CLIPPre-training Data=WIT-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 51.6 | |
| TIES-Merging w/ AWQMerging Strategy=TIES-Merging, Quantization Method=AWQ, Model Backbone=CLIP-ViT-B/32, Bit-width=4-bit2026.05 | 51.56 | |
| nCLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 51.2 | |
| xCLIPBackbone=ViT-B/16, Pre-trained on=IT35M, Mode=Zero-shot2022.10 | 51.1 | |
| OpenCLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 51.1 | |
| Simple Averaging + RTNMerging Strategy=Simple Averaging, Quantization Method=RTN, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 51.07 | |
| CLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 51 | |
| CLIP-PGSImage Encoder=ViT-B/16, p=0.3, Protocol=Zero-shot2025.03 | 50.8 | |
| TIES-Merging + RTNMerging Strategy=TIES-Merging, Quantization Method=RTN, Bit-width=4-bit, Backbone=CLIP-ViT-B/322026.05 | 50.61 | |
| FLIPPre-training Data=LAION-400M, Backbone=ViT-L/14, Evaluation Protocol=Zero-shot classification2024.07 | 50.3 | |
| SLIPZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 50.3 | |
| ITOZero-shot=true, Backbone=ViT-B/16, Pre-training Dataset=Laion100M, Epochs=302026.03 | 50.3 | |
| CLIP-PGSImage Encoder=ViT-S/16, p=0.3, Protocol=Zero-shot2025.03 | 50.2 | |
| A-CLIPImage Encoder=ViT-B/16, Protocol=Zero-shot2025.03 | 50.1 |