Topic Classification on AG News (test)
94.91AccuracyCUD
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| CUDStudent Model Architecture=6L-768D2026.02 | 94.91 | — | — | — | — | — | |
| CKDStudent Model Architecture=6L-768D2026.02 | 94.72 | — | — | — | — | — | |
| FT TeacherModel Role=Teacher2026.02 | 94.69 | — | — | — | — | — | |
| MGSKDStudent Model Architecture=6L-768D, trained with distillation at pretraining stage=true2026.02 | 94.64 | — | — | — | — | — | |
| AD-KDStudent Model Architecture=6L-768D2026.02 | 94.57 | — | — | — | — | — | |
| PKDStudent Model Architecture=6L-768D2026.02 | 94.54 | — | — | — | — | — | |
| PKDStudent Model Architecture=4L-256D2026.02 | 94.37 | — | — | — | — | — | |
| LKDStudent Model Architecture=4L-256D2026.02 | 94.28 | — | — | — | — | — | |
| CKDStudent Model Architecture=4L-256D2026.02 | 94.24 | — | — | — | — | — | |
| LKDStudent Model Architecture=6L-768D2026.02 | 94.23 | — | — | — | — | — | |
| TinyBERTStudent Model Architecture=6L-768D, trained with distillation at pretraining stage=true2026.02 | 94.18 | — | — | — | — | — | |
| CUDStudent Model Architecture=4L-256D2026.02 | 94.11 | — | — | — | — | — | |
| AD-KDStudent Model Architecture=4L-256D2026.02 | 94.03 | — | — | — | — | — | |
| FusionTraining Data=100% (4,000)2025.12 | 92.4 | 92.4 | — | — | 92.6 | 92.4 | |
| SFTSLM Backbone=RoBERTa-Base2025.06 | 92.29 | — | — | — | — | — | |
| FusionTraining Data=20% (800)2025.12 | 92.2 | 92.2 | — | — | 92.3 | 92.2 | |
| FusionTraining Data=40% (1,600)2025.12 | 92.2 | 92.2 | — | — | 92.4 | 92.2 | |
| RoBERTaTraining Data=100% (4,000)2025.12 | 92.2 | 92.2 | — | — | 92.3 | 92.2 | |
| FusionTraining Data=60% (2,400)2025.12 | 92 | 92 | — | — | 92.2 | 92 | |
| FusionTraining Data=80% (3,200)2025.12 | 91.6 | 91.6 | — | — | 91.7 | 91.6 | |
| RoBERTaTraining Data=80% (3,200)2025.12 | 91.4 | 91.4 | — | — | 91.5 | 91.4 | |
| RoBERTaTraining Data=40% (1,600)2025.12 | 91 | 91.1 | — | — | 91.3 | 91 | |
| RoBERTaTraining Data=60% (2,400)2025.12 | 91 | 91 | — | — | 91.1 | 91 | |
| CAPOModel=Qwen3-30B, Token Budget=7.5M2026.05 | 90 | — | — | — | — | — | |
| RoBERTaTraining Data=20% (800)2025.12 | 89.8 | 89.9 | — | — | 90.2 | 89.8 | |
| CanDistaddLLM Annotator=GPT-3.5, SLM Backbone=RoBERTa-Base2025.06 | 89.46 | — | — | — | — | — | |
| NSGA-II-POModel=Qwen3-30B, Token Budget=7.5M2026.05 | 89.3 | — | — | — | — | — | |
| SuperICLLLM Annotator=GPT-3.5, SLM Backbone=RoBERTa-Base2025.06 | 88.79 | — | — | — | — | — | |
| CanDistallLLM Annotator=GPT-3.5, SLM Backbone=RoBERTa-Base2025.06 | 88.78 | — | — | — | — | — | |
| Extra AnnotationEvaluation Protocol=ICL, Number of shots (K)=Increased2023.07 | 88.7 | — | — | — | — | — | |
| Extra AnnotationEvaluation Protocol=Fine-tuning, Number of shots (K)=Increased, Backbone=RoBERTa-Large2023.07 | 88.66 | — | — | — | — | — | |
| FreeALLLM Annotator=GPT-3.5, SLM Backbone=RoBERTa-Base2025.06 | 88.64 | — | — | — | — | — | |
| MO-CAPOModel=Qwen3-30B, Token Budget=7.5M2026.05 | 88.5 | — | — | — | — | — | |
| DistillationLLM Annotator=GPT-3.5, SLM Backbone=RoBERTa-Base2025.06 | 88.29 | — | — | — | — | — | |
| Few-shotLLM Annotator=GPT-3.52025.06 | 88.05 | — | — | — | — | — | |
| SCLLM Annotator=GPT-3.52025.06 | 87.96 | — | — | — | — | — | |
| Zero-shotLLM Annotator=GPT-3.52025.06 | 87.24 | — | — | — | — | — | |
| GEPAModel=Qwen3-30B, Token Budget=7.5M2026.05 | 87 | — | — | — | — | — | |
| CAPOModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 86.9 | — | — | — | — | — | |
| MO-CAPOModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 86.7 | — | — | — | — | — | |
| ICRBackbone=Llama2-7B2025.09 | 86.6 | — | — | — | — | — | |
| CoTAMEvaluation Protocol=ICL, Number of shots (K)=32023.07 | 86.4 | — | — | — | — | — | |
| M²IVBackbone=Llama2-7B2025.09 | 86.4 | — | — | — | — | — | |
| GEPAModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 86.3 | — | — | — | — | — | |
| LOTClassLearning Paradigm=Reference, Use task-specific corpus=true2023.05 | 86.2 | — | — | — | — | — | |
| EvoPromptGAModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 86.1 | — | — | — | — | — | |
| COTDAEvaluation Protocol=ICL, Number of shots (K)=32023.07 | 86 | — | — | — | — | — | |
| GEPAModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 86 | — | — | — | — | — | |
| EvoPromptGAModel=Qwen3-30B, Token Budget=7.5M2026.05 | 86 | — | — | — | — | — | |
| LIVEBackbone=Llama2-7B2025.09 | 86 | — | — | — | — | — | |
| InitialModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 85.9 | — | — | — | — | — | |
| CoTAMEvaluation Protocol=Fine-tuning, Number of shots (K)=10, Backbone=RoBERTa-Large2023.07 | 85.8 | — | — | — | — | — | |
| LLM Pseudo LabelEvaluation Protocol=ICL, Number of shots (K)=32023.07 | 85.8 | — | — | — | — | — | |
| X-ClassLearning Paradigm=Reference, Use task-specific corpus=true2023.05 | 85.7 | — | — | — | — | — | |
| LLM Pseudo LabelEvaluation Protocol=Fine-tuning, Number of shots (K)=10, Backbone=RoBERTa-Large2023.07 | 85.64 | — | — | — | — | — | |
| InitialModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 85.6 | — | — | — | — | — | |
| EvoPromptGAModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 85.6 | — | — | — | — | — | |
| BaseEvaluation Protocol=ICL, Number of shots (K)=32023.07 | 85.5 | — | — | — | — | — | |
| NSGA-II-POModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 85.5 | — | — | — | — | — | |
| I2CLBackbone=Llama2-7B2025.09 | 85.5 | — | — | — | — | — | |
| AnnoLLMLLM Annotator=GPT-3.52025.06 | 85.39 | — | — | — | — | — | |
| OpenAITraining Data=100% (4,000)2025.12 | 85.3 | 84.9 | — | — | 86.8 | 84.7 | |
| FlipDA++Evaluation Protocol=ICL, Number of shots (K)=32023.07 | 85.2 | — | — | — | — | — | |
| OpenAITraining Data=60% (2,400)2025.12 | 85.2 | 84.7 | — | — | 86.1 | 84.4 | |
| COTDAEvaluation Protocol=Fine-tuning, Number of shots (K)=10, Backbone=RoBERTa-Large2023.07 | 85.19 | — | — | — | — | — | |
| OpenAITraining Data=20% (800)2025.12 | 85.1 | 84.7 | — | — | 86.3 | 84.6 | |
| REGENLearning Paradigm=Zero-shot Learning via Generating Task-specific Datasets, Standard Deviation=0.82023.05 | 85 | — | — | — | — | — | |
| InitialModel=Qwen3-30B, Token Budget=7.5M2026.05 | 85 | — | — | — | — | — | |
| NSGA-II-POModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 84.9 | — | — | — | — | — | |
| KPTLearning Paradigm=Reference, Use task-specific corpus=true, Use additional knowledge base=true2023.05 | 84.8 | — | — | — | — | — | |
| MO-CAPOModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 84.8 | — | — | — | — | — | |
| FlipDA++Evaluation Protocol=Fine-tuning, Number of shots (K)=10, Backbone=RoBERTa-Large2023.07 | 84.72 | — | — | — | — | — | |
| CAPOModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 84.4 | — | — | — | — | — | |
| OpenAITraining Data=80% (3,200)2025.12 | 84.1 | 83.7 | — | — | 84.9 | 83.2 | |
| OpenAITraining Data=40% (1,600)2025.12 | 83.9 | 83.5 | — | — | 84.7 | 83.4 | |
| CoTLLM Annotator=GPT-3.52025.06 | 83.05 | — | — | — | — | — | |
| AttrPromptClassifier=DistilBERT, Training Protocol=Simple fine-tuning with standard cross-entropy loss2023.06 | 82.74 | — | — | — | — | — | |
| No ExampleEvaluation Protocol=ICL, Number of shots (K)=02023.07 | 81.3 | — | — | — | — | — | |
| BaseEvaluation Protocol=Fine-tuning, Number of shots (K)=10, Backbone=RoBERTa-Large2023.07 | 81.05 | — | — | — | — | — | |
| Few-shot*Backbone=Llama2-7B, Few-shot settings=5-shot ID2025.09 | 81 | — | — | — | — | — | |
| ProGenClassifier=DistilBERT, Training Protocol=Dedicated training techniques2023.06 | 80.81 | — | — | — | — | — | |
| SunGenClassifier=DistilBERT, Training Protocol=Dedicated training techniques2023.06 | 80.49 | — | — | — | — | — | |
| ICRBackbone=Qwen2.5-7B2025.09 | 80.4 | — | — | — | — | — | |
| Deep-ThinkingIn-context learning setting=w/ dev set2023.05 | 80.3 | — | — | — | — | — | |
| Few-shot*Backbone=Qwen2.5-7B, Few-shot settings=5-shot ID2025.09 | 80.2 | — | — | — | — | — | |
| ReGenClassifier=DistilBERT, Training Protocol=Dedicated training techniques2023.06 | 80.18 | — | — | — | — | — | |
| Mining (Re-implementation)Learning Paradigm=Zero-shot Learning via Generating Task-specific Datasets, Concurrent Work=true, Fair Comparison Setup=true, Standard Deviation=1.02023.05 | 79.7 | — | — | — | — | — | |
| M²IVBackbone=Qwen2.5-7B2025.09 | 79.6 | — | — | — | — | — | |
| MiningLearning Paradigm=Zero-shot Learning via Generating Task-specific Datasets, Concurrent Work=true2023.05 | 79.2 | — | — | — | — | — | |
| LIVEBackbone=Qwen2.5-7B2025.09 | 79 | — | — | — | — | — | |
| KNN-PromptLearning Paradigm=Zero-shot Learning via Direct Inferencing2023.05 | 78.8 | — | — | — | — | — | |
| NSP-BERTLearning Paradigm=Zero-shot Learning via Direct Inferencing2023.05 | 78.1 | — | — | — | — | — | |
| TE-NLI (Best)Learning Paradigm=Labeled data usage, Use auxiliary labeled data=true2023.05 | 78 | — | — | — | — | — | |
| LENSIn-context learning setting=w/ dev set2023.05 | 77.9 | — | — | — | — | — | |
| SuperGenLearning Paradigm=Zero-shot Learning via Generating Task-specific Datasets, Standard Deviation=1.52023.05 | 77.4 | — | — | — | — | — | |
| SuperGenClassifier=DistilBERT, Training Protocol=Dedicated training techniques2023.06 | 77.4 | — | — | — | — | — | |
| I2CLBackbone=Qwen2.5-7B2025.09 | 77 | — | — | — | — | — | |
| NLI-STLearning Paradigm=Reference, Use auxiliary labeled data=true, Use task-specific corpus=true2023.05 | 76.5 | — | — | — | — | — | |
| ZeroGenClassifier=DistilBERT, Training Protocol=Dedicated training techniques2023.06 | 76.48 | — | — | — | — | — | |
| RandomIn-context learning setting=w/ dev set2023.05 | 74.6 | — | — | — | — | — |