Semantic Textual Similarity on STS-B
92.9Spearman's Rho (x100)UD+-XXL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UD+-XXLMode=Fully-supervised, Backbone=T5-XXL encoder, Model Parameters=11B2022.11 | 92.9 | — | |
| RLLRModel=LLaMA2, Model Size=7B2024.05 | 92.31 | — | |
| Tay et al. (2022)Mode=Fully-supervised, Model Parameters=4x of UD (~44B)2022.11 | 92.3 | — | |
| RLLRModel=LLaMA2, Model Size=13B2024.05 | 92.23 | — | |
| RLLRMIXEDModel=LLaMA2, Model Size=13B2024.05 | 92.23 | — | |
| RLLRMIXEDModel=LLaMA2, Model Size=7B2024.05 | 92.07 | — | |
| RLHFModel=LLaMA2, Model Size=7B2024.05 | 92.02 | — | |
| SFT w. rat.Model=LLaMA2, Model Size=7B2024.05 | 91.83 | — | |
| SFT w. rat.Model=LLaMA2, Model Size=13B2024.05 | 91.78 | — | |
| RLHFModel=LLaMA2, Model Size=13B2024.05 | 91.49 | — | |
| prob-weighted EV (M2)Model=Qwen2.5-14B2026.05 | 90.8 | — | |
| supervised residual probe (M3)Model=Qwen2.5-14B2026.05 | 90.2 | — | |
| SFTModel=LLaMA2, Model Size=13B2024.05 | 90.12 | — | |
| supervised residual probe (M3)Model=Gemma-3-27B2026.05 | 89.3 | — | |
| SFTModel=LLaMA2, Model Size=7B2024.05 | 89.24 | — | |
| LoRAModel=DeBERTa v3 Base [23], Adapter Rank=162026.06 | 89.09 | — | |
| RLLRModel=Bloom, Model Size=7B2024.05 | 89.04 | — | |
| RLHFModel=Bloom, Model Size=7B2024.05 | 88.96 | — | |
| RLLRMIXEDModel=Bloom, Model Size=7B2024.05 | 88.95 | — | |
| supervised residual probe (M3)Model=Llama-3.1-8B2026.05 | 88.7 | — | |
| SFT w. rat.Model=Bloom, Model Size=7B2024.05 | 88.58 | — | |
| prompted argmax (M1)Model=Qwen2.5-14B2026.05 | 88.4 | — | |
| supervised residual probe (M3)Model=Gemma-3-12B2026.05 | 88.1 | — | |
| SFTModel=Bloom, Model Size=7B2024.05 | 87.88 | — | |
| RLLRModel=Bloom, Model Size=3B2024.05 | 87.58 | — | |
| cLAModel=DeBERTa v3 Base [23], Adapter Rank=162026.06 | 87.56 | — | |
| supervised residual probe (M3)Model=Qwen2.5-7B2026.05 | 87.2 | — | |
| RLLRMIXEDModel=Bloom, Model Size=3B2024.05 | 87.17 | — | |
| prob-weighted EV (M2)Model=Qwen2.5-7B2026.05 | 86.9 | — | |
| prob-weighted EV (M2)Model=Gemma-3-12B2026.05 | 86.9 | — | |
| SFTModel=Bloom, Model Size=3B2024.05 | 86.66 | — | |
| SFT w. rat.Model=Bloom, Model Size=3B2024.05 | 86.58 | — | |
| zero-shot BDAS-1D (M4)Model=Qwen2.5-14B2026.05 | 86.4 | — | |
| RLHFModel=Bloom, Model Size=3B2024.05 | 86.23 | — | |
| BERT + AlignerBackbone=BERT-base, Evaluation Protocol=Fine-tuned, Alignment Feature=Conditional alignment probability2021.06 | 86 | 86.8 | |
| BERTBackbone=BERT-base, Evaluation Protocol=Fine-tuned2021.06 | 85.8 | 86.7 | |
| zero-shot BDAS-1D (M4)Model=Gemma-3-12B2026.05 | 85.1 | — | |
| SGPT-5.8BBatch Size=1024, BitFit=true, Pooling=weightedmean, Training=NLI2022.02 | 84.7 | — | |
| prompted argmax (M1)Model=Qwen2.5-7B2026.05 | 84.5 | — | |
| prob-weighted EV (M2)Model=Gemma-3-27B2026.05 | 84.4 | — | |
| zero-shot BDAS-1D (M4)Model=Qwen2.5-7B2026.05 | 84 | — | |
| GLOTArchitecture Type=Encoder-only, Backbone=BERT2026.03 | 83.85 | — | |
| zero-shot BDAS-1D (M4)Model=Gemma-3-27B2026.05 | 83.1 | — | |
| SGPT-2.7BBatch Size=1024, BitFit=true, Pooling=weightedmean, Training=NLI2022.02 | 82.6 | — | |
| prompted argmax (M1)Model=Gemma-3-12B2026.05 | 82.6 | — | |
| SGPT-1.3BBatch Size=1024, BitFit=true, Pooling=weightedmean, Training=NLI2022.02 | 82.3 | — | |
| Davinci SimilarityDate=June 20222022.02 | 82.2 | — | |
| LLM-ce-ft(7B)#Data=0.3M, #Param.=7B2024.06 | 81.72 | 78.73 | |
| zero-shot BDAS-1D (M4)Model=Llama-3.1-8B2026.05 | 81.5 | — | |
| BM25Training=OOD Unsupervised2022.02 | 80.8 | — | |
| GLOTArchitecture Type=Decoder-only, Backbone=Mistral-7B2026.03 | 80.51 | — | |
| prompted argmax (M1)Model=Gemma-3-27B2026.05 | 80 | — | |
| SGPT-0.1BBatch Size=64, Pooling=weightedmean, Training=NLI2022.02 | 79.5 | — | |
| SGPT-0.1BBatch Size=1024, BitFit=true, Pooling=weightedmean, Training=NLI2022.02 | 79 | — | |
| SBERT-base-nli-v2Batch Size=64, Training=NLI2022.02 | 78.9 | — | |
| Ada SimilarityDate=Mar 20222022.02 | 78.9 | — | |
| SBERT-base-nli-v2Batch Size=64, BitFit=true, Training=NLI2022.02 | 78.8 | — | |
| Curie SimilarityDate=Mar 20222022.02 | 78 | — | |
| DINO (STS-A-x2)supervision=unsupervised, unlabeled_data=STS2021.04 | 77.82 | — | |
| S-ROBERTa (base)supervision=supervised2021.04 | 77.77 | — | |
| BGE(326M)#Data=100M, #Param.=326M2024.06 | 77.63 | 77.65 | |
| SGPT-0.1BBatch Size=64, BitFit=true, Pooling=weightedmean, Training=NLI2022.02 | 77.5 | — | |
| D2LLM-ft(7B)#Data=0.3M, #Param.=7B2024.06 | 77.29 | 73.46 | |
| S-BERT (base)supervision=supervised2021.04 | 77.03 | — | |
| LLM-ce(7B)2024.06 | 76.8 | 74.53 | |
| prob-weighted EV (M2)Model=Llama-3.1-8B2026.05 | 76.8 | — | |
| Pretended CoTArchitecture Type=Decoder-only, Backbone=Mistral-7B2026.03 | 76.66 | — | |
| DINO (STS-A-x1x2)supervision=unsupervised2021.04 | 76.51 | — | |
| PromptEOLArchitecture Type=Decoder-only, Backbone=Mistral-7B2026.03 | 75.77 | — | |
| USEsupervision=supervised2021.04 | 74.92 | — | |
| Knowledge EnhancementArchitecture Type=Decoder-only, Backbone=Mistral-7B2026.03 | 74.09 | — | |
| BERTlarge-flow (target)Backbone=BERT-large, Pooling Strategy=Last 2 layers average, Flow Training Source=Target dataset2020.11 | 72.26 | — | |
| D2LLM(7B)#Data=0.3M, #Param.=7B2024.06 | 71.94 | 72.73 | |
| BERTbase-flow (target)Backbone=BERT-base, Pooling Strategy=Last 2 layers average, Flow Training Source=Target dataset2020.11 | 70.72 | — | |
| Li et al. (2020)supervision=unsupervised, unlabeled_data=STS2021.04 | 70.72 | — | |
| prompted argmax (M1)Model=Llama-3.1-8B2026.05 | 70.7 | — | |
| PromptBERTArchitecture Type=Encoder-only, Backbone=BERT2026.03 | 70.6 | — | |
| LLaRRA(7B)#Data=0.3M, #Param.=7B2024.06 | 70.01 | 69.1 | |
| Zhang et al. (2020)supervision=unsupervised, unlabeled_data=NLI2021.04 | 69.21 | — | |
| BERTlarge-flow (NLI*)Backbone=BERT-large, Pooling Strategy=Last 2 layers average, Flow Training Source=NLI corpus2020.11 | 68.09 | — | |
| InferSent, Glovesupervision=supervised2021.04 | 68.03 | — | |
| BGE-ft(326M)#Data=0.3M, #Param.=326M2024.06 | 67.17 | 66.48 | |
| Udever(7B)#Data=0.3M, #Param.=7B2024.06 | 66.01 | 65.09 | |
| ConceptsModel=Llama 3.1 8B, λ=1.02026.03 | 65.05 | — | |
| ConceptsModel=Llama 3.2 3B, λ=1.02026.03 | 64.82 | — | |
| ConceptsModel=Llama 3.1 8B, λ=1.02026.03 | 64.62 | — | |
| ConceptsModel=Llama 3.2 3B, λ=1.02026.03 | 64.35 | — | |
| ConceptsModel=Llama 3.1 8B, λ=0.752026.03 | 63.68 | — | |
| ConceptsModel=Llama 3.1 8B, λ=0.752026.03 | 63.39 | — | |
| ConceptsModel=Llama 3.2 3B, λ=0.752026.03 | 63.37 | — | |
| ConceptsModel=Llama 3.2 3B, λ=0.752026.03 | 62.86 | — | |
| ConceptsModel=Llama 3.2 1B, λ=1.02026.03 | 62.74 | — | |
| ConceptsModel=Llama 3.1 8B, λ=0.52026.03 | 62.67 | — | |
| ConceptsModel=Llama 3.1 8B, λ=0.52026.03 | 62.47 | — | |
| ConceptsModel=Llama 3.2 1B, λ=1.02026.03 | 62.38 | — | |
| ConceptsModel=Llama 3.2 3B, λ=0.52026.03 | 62.08 | — | |
| ConceptsModel=Llama 3.2 3B, λ=0.52026.03 | 61.85 | — | |
| ConceptsModel=Llama 3.1 8B, λ=0.252026.03 | 61.6 | — | |
| ConceptsModel=Llama 3.1 8B, λ=0.252026.03 | 61.14 | — | |
| ConceptsModel=Llama 3.2 1B, λ=0.752026.03 | 61.12 | — |