Text classification on WIPO
84.6F1 ScoreMistral-7B-Instruct-v0.2
Evaluation Results
| Method | Links | |
|---|---|---|
| Mistral-7B-Instruct-v0.2Approach=Instruction finetuning, Total Parameters=7.4B, Trainable Parameters=167.8M2025.12 | 84.6 | |
| Phi-4-reasoningApproach=Instruction finetuning, Total Parameters=14.9B, Trainable Parameters=222.8M2025.12 | 82 | |
| Mistral-7B-v0.3Approach=Instruction finetuning, Total Parameters=714M, Trainable Parameters=167.8M2025.12 | 81.9 | |
| Llama-3.1-8B-InstructApproach=Instruction finetuning, Total Parameters=8.2B, Trainable Parameters=167.8M2025.12 | 81.7 | |
| Qwen3-4B-Instruct-2507Approach=Instruction finetuning, Total Parameters=4.2B, Trainable Parameters=132.1M2025.12 | 81.6 | |
| Qwen3-8BApproach=Instruction finetuning, Total Parameters=8.4B, Trainable Parameters=174.6M2025.12 | 80.9 | |
| ModernBERT-baseApproach=BERT baselines, Total Parameters=149M, Trainable Parameters=149M2025.12 | 80.6 | |
| Llama-3.2-3B-InstructApproach=Instruction finetuning, Total Parameters=3.3B, Trainable Parameters=97.3M2025.12 | 80.5 | |
| gpt-oss-20bApproach=Instruction finetuning, Total Parameters=3.3B, Trainable Parameters=97.3M2025.12 | 80.5 | |
| Llama-3.2-3BApproach=Instruction finetuning, Total Parameters=3.3B, Trainable Parameters=97.3M2025.12 | 80.5 | |
| ModernBERT-base-PTApproach=BERT baselines, Total Parameters=149M, Trainable Parameters=149M2025.12 | 80.2 | |
| PatentBERTApproach=BERT baselines, Total Parameters=346M, Trainable Parameters=346M2025.12 | 80.1 | |
| Phi-3-mini-4k-instructApproach=Embedding-based finetuning, rank (r)=16, Total Parameters=3.2B, Trainable Parameters=15.2M2025.12 | 79.7 | |
| Gemma-2-2BApproach=Embedding-based finetuning (r=16), Total Parameters=2.6B, Trainable Parameters=20.8M2025.12 | 79.7 | |
| ModernBERT-base-VXApproach=BERT baselines, Total Parameters=149M, Trainable Parameters=149M2025.12 | 79.6 | |
| Phi-3-mini-4k-instructApproach=Embedding-based finetuning, rank (r)=8, Total Parameters=3.3B, Trainable Parameters=7.6M2025.12 | 79.4 | |
| Llama-3.1-8BApproach=Embedding-based finetuning, rank (r)=16, Total Parameters=1.2B, Trainable Parameters=42.0M2025.12 | 79.4 | |
| LFM2-2.6BApproach=Instruction finetuning, Total Parameters=2.7B, Trainable Parameters=97.8M2025.12 | 79.4 | |
| Qwen2.5-1.5BApproach=Embedding-based finetuning, rank (r)=16, Total Parameters=2.6B, Trainable Parameters=18.5M2025.12 | 79.3 | |
| Qwen2.5-1.5BbApproach=Embedding-based finetuning, rank (r)=8, Total Parameters=2.7B, Trainable Parameters=9.3M2025.12 | 78.8 | |
| Gemma-3-270mApproach=Instruction finetuning, Total Parameters=270M, Trainable Parameters=270M2025.12 | 78.7 | |
| SmolLM3-3BApproach=Instruction finetuning, Total Parameters=3.2B, Trainable Parameters=120.9M2025.12 | 78.7 | |
| Llama-3.2-1BApproach=Embedding-based finetuning (r=16), Total Parameters=1.2B, Trainable Parameters=11.3M2025.12 | 78.7 | |
| Llama-3.2-3BApproach=Embedding-based finetuning (r=8), Total Parameters=3.2B, Trainable Parameters=12.2M2025.12 | 78.5 | |
| Gemma-2-2BApproach=Instruction finetuning, Total Parameters=2.7B, Trainable Parameters=83.1M2025.12 | 78.5 | |
| Llama-3.2-1BApproach=Instruction finetuning, Total Parameters=1.3B, Trainable Parameters=45.1M2025.12 | 78.4 | |
| Llama-3.2-1BApproach=Embedding-based finetuning (r=8), Total Parameters=1.2B, Trainable Parameters=5.6M2025.12 | 78.3 | |
| Llama-3.1-8BApproach=Embedding-based finetuning, rank (r)=8, Total Parameters=1.3B, Trainable Parameters=21.0M2025.12 | 77.9 | |
| Gemma-2-2BApproach=Embedding-based finetuning (r=8), Total Parameters=2.6B, Trainable Parameters=10.4M2025.12 | 77.9 | |
| Llama-3.2-3BApproach=Embedding-based finetuning (r=16), Total Parameters=3.2B, Trainable Parameters=24.3M2025.12 | 77.9 | |
| Gemma-3-270m-itApproach=Instruction finetuning, Total Parameters=270M, Trainable Parameters=270M2025.12 | 77.6 | |
| Mistral-7B-v0.3Approach=Embedding-based finetuning (r=16), Total Parameters=7.2B, Trainable Parameters=42.0M2025.12 | 77.2 | |
| Mistral-7B-v0.3Approach=Embedding-based finetuning (r=8), Total Parameters=7.2B, Trainable Parameters=21.0M2025.12 | 76.8 | |
| Llama-3.2-1B-InstructApproach=Instruction finetuning, Total Parameters=1.3B, Trainable Parameters=45.1M2025.12 | 76.2 | |
| OpenReasoning-Nemotron-1.5BApproach=Instruction finetuning, Total Parameters=1.6B, Trainable Parameters=73.9M2025.12 | 75.8 | |
| Qwen3-0.6BApproach=Instruction finetuning, Total Parameters=636.4M, Trainable Parameters=40.4M2025.12 | 73.8 | |
| Qwen2-0.5B-InstructApproach=Instruction finetuning, Total Parameters=529.2M, Trainable Parameters=35.2M2025.12 | 68.6 | |
| Llama-3.2-1B-InstructApproach=Embedding-based finetuning (r=16), Total Parameters=1.2B, Trainable Parameters=11.3M2025.12 | 60.2 | |
| Llama-3.2-1B-InstructApproach=Embedding-based finetuning (r=8), Total Parameters=1.2B, Trainable Parameters=5.6M2025.12 | 59.2 |