Paraphrase Detection on PAWS
94.6AccuracyFLAN-T5
Evaluation Results
| Method | Links | |
|---|---|---|
| FLAN-T5Model Variant=xlarge, Model Parameters=3B2023.07 | 94.6 | |
| FLAN-T5Model Variant=large, Model Parameters=780M2023.07 | 94 | |
| ALIGNModel Variant=large, Model Parameters=355M2023.07 | 92.6 | |
| ALIGNModel Variant=base, Model Parameters=125M2023.07 | 92.3 | |
| fs-X-ICL (ChatGPT)Model=Mistral 7B2023.11 | 72.5 | |
| ICLModel=Mistral 7B2023.11 | 68.3 | |
| GENICLBackbone=LLaMA-7B, Evaluation Setting=Few-shot (ICL)2025.05 | 63.9 | |
| Se²2024.02 | 58.4 | |
| SBERTBackbone=LLaMA-7B, Evaluation Setting=Few-shot (ICL)2025.05 | 58.3 | |
| EPRBackbone=LLaMA-7B, Evaluation Setting=Few-shot (ICL)2025.05 | 57.7 | |
| CBDSBackbone=LLaMA-7B, Evaluation Setting=Few-shot (ICL)2025.05 | 57.6 | |
| LLM-RBackbone=LLaMA-7B, Evaluation Setting=Few-shot (ICL)2025.05 | 57.5 | |
| BM25Backbone=LLaMA-7B, Evaluation Setting=Few-shot (ICL)2025.05 | 56.5 | |
| Best-of-102024.02 | 55.8 | |
| E5baseBackbone=LLaMA-7B, Evaluation Setting=Few-shot (ICL)2025.05 | 55.6 | |
| Zero-shotBackbone=LLaMA-7B, Evaluation Setting=Zero-shot2025.05 | 53 | |
| Zero-shot2024.02 | 51.8 | |
| AES2024.02 | 51.7 | |
| Random2024.02 | 50.4 | |
| BM252024.02 | 49.8 | |
| RandomBackbone=LLaMA-7B, Evaluation Setting=Few-shot (ICL)2025.05 | 49.6 | |
| UPRISE2024.02 | 49.2 | |
| Instructor2024.02 | 49.1 | |
| SBERT2024.02 | 49 |