Question Answering on CommonsenseQA
89.3AccuracyEntropy Equilibrium Sampling (EES)
Evaluation Results
| Method | Links | |
|---|---|---|
| Entropy Equilibrium Sampling (EES)LM=Qwen2.5-32B, tau=0.52025.11 | 89.3 | |
| MirostatLM=Qwen2.5-32B, tau=0.5, Auxiliary Hyperparameter=32025.11 | 89.24 | |
| GPT-4oApproach=CoT, Learning Paradigm=Vanilla2024.11 | 86.5 | |
| Entropy Equilibrium Sampling (EES)LM=Qwen2.5-7B, tau=0.52025.11 | 84.42 | |
| JoBSModel Selection=JoBS, Data Selection=JoBS2026.02 | 84.3 | |
| TypicalLM=Qwen2.5-7B, tau=0.8, Auxiliary Hyperparameter=0.22025.11 | 84.11 | |
| Entropy Equilibrium Sampling (EES)LM=Qwen2.5-7B, tau=0.82025.11 | 83.95 | |
| MirostatLM=Qwen2.5-7B, tau=0.5, Auxiliary Hyperparameter=2.52025.11 | 83.88 | |
| Top-pLM=Qwen2.5-7B, tau=0.5, Auxiliary Hyperparameter=0.752025.11 | 83.77 | |
| Temperature SamplingLM=Qwen2.5-7B, tau=0.52025.11 | 83.7 | |
| Entropy Equilibrium Sampling (EES)LM=Qwen2.5-7B, tau=12025.11 | 83.64 | |
| AdaptiveLM=Qwen2.5-7B, tau=0.5, Auxiliary Hyperparameter=0.00052025.11 | 83.62 | |
| MirostatLM=Qwen2.5-7B, tau=1, Auxiliary Hyperparameter=2.52025.11 | 83.55 | |
| AdaptiveLM=Qwen2.5-7B, tau=0.8, Auxiliary Hyperparameter=0.0052025.11 | 83.46 | |
| GPT-4oApproach=Zero-shot, Learning Paradigm=Vanilla2024.11 | 83.4 | |
| AdaptiveLM=Qwen2.5-7B, tau=1, Auxiliary Hyperparameter=0.012025.11 | 83.39 | |
| TypicalLM=Qwen2.5-7B, tau=0.5, Auxiliary Hyperparameter=0.952025.11 | 83.36 | |
| MirostatLM=Qwen2.5-7B, tau=0.8, Auxiliary Hyperparameter=2.52025.11 | 83.23 | |
| Qwen 2.5-7BApproach=Ours, Learning Paradigm=Fine-tuned2024.11 | 83.2 | |
| EtaLM=Qwen2.5-7B, tau=0.5, Auxiliary Hyperparameter=0.00092025.11 | 82.98 | |
| TypicalLM=Qwen2.5-7B, tau=1, Auxiliary Hyperparameter=0.22025.11 | 82.95 | |
| Top-kLM=Qwen2.5-7B, tau=0.5, Auxiliary Hyperparameter=102025.11 | 82.75 | |
| Top-kLM=Qwen2.5-7B, tau=1, Auxiliary Hyperparameter=202025.11 | 82.65 | |
| Top-pLM=Qwen2.5-7B, tau=0.8, Auxiliary Hyperparameter=0.82025.11 | 82.64 | |
| Top-kLM=Qwen2.5-7B, tau=0.8, Auxiliary Hyperparameter=1002025.11 | 82.42 | |
| Temperature SamplingLM=Qwen2.5-7B, tau=0.82025.11 | 82.39 | |
| LLaMA-3.1-8BApproach=Ours, Learning Paradigm=Fine-tuned2024.11 | 82.3 | |
| EtaLM=Qwen2.5-7B, tau=1, Auxiliary Hyperparameter=0.00062025.11 | 82.1 | |
| Temperature SamplingLM=Qwen2.5-7B, tau=12025.11 | 82.01 | |
| Top-pLM=Qwen2.5-7B, tau=1, Auxiliary Hyperparameter=0.82025.11 | 81.93 | |
| EtaLM=Qwen2.5-7B, tau=0.8, Auxiliary Hyperparameter=0.0022025.11 | 81.88 | |
| MoRAL (layer-wise)Backbone=Mistral-7B, Evaluation Protocol=domain-specific fine-tuning2026.03 | 81.57 | |
| LLaMA-3.1-70BApproach=CoT, Learning Paradigm=Vanilla2024.11 | 81.5 | |
| AutoLoRAModel Selection=AutoLoRA, Data Selection=BO2026.02 | 81.5 | |
| AdaFuseBackbone=Mistral-7B, Evaluation Protocol=domain-specific fine-tuning2026.03 | 81.29 | |
| BOModel Selection=BO, Data Selection=IF2026.02 | 81.1 | |
| BOModel Selection=BO, Data Selection=BO2026.02 | 80.7 | |
| DefaultModel Selection=Default, Data Selection=BO2026.02 | 80.6 | |
| PESC (block-wise)Backbone=Mistral-7B, Evaluation Protocol=domain-specific fine-tuning2026.03 | 80.46 | |
| RoBoTModel Selection=RoBoT, Data Selection=BO2026.02 | 80.2 | |
| Qwen 2.5-7BApproach=Planning-token, Learning Paradigm=Fine-tuned2024.11 | 80.1 | |
| DARTSModel Selection=DARTS, Data Selection=Diversity2026.02 | 80.1 | |
| LoRABackbone=Mistral-7B, Evaluation Protocol=domain-specific fine-tuning2026.03 | 79.85 | |
| AutoLoRAModel Selection=AutoLoRA, Data Selection=LESS2026.02 | 79.8 | |
| BOModel Selection=BO, Data Selection=Default2026.02 | 79.7 | |
| DARTSModel Selection=DARTS, Data Selection=Default2026.02 | 79.6 | |
| DARTSModel Selection=DARTS, Data Selection=BO2026.02 | 79.6 | |
| RoBoTModel Selection=RoBoT, Data Selection=IF2026.02 | 79.4 | |
| BOModel Selection=BO, Data Selection=LESS2026.02 | 79.4 | |
| BOModel Selection=BO, Data Selection=Diversity2026.02 | 79.4 | |
| DefaultModel Selection=Default, Data Selection=IF2026.02 | 79.3 | |
| FreeLB-ROBERTAseen_dataset_during_training=true2020.05 | 79.1 | |
| Qwen 2.5-7BApproach=Zero-shot, Learning Paradigm=Vanilla2024.11 | 78.9 | |
| AutoLoRAModel Selection=AutoLoRA, Data Selection=Default2026.02 | 78.9 | |
| FULLModel=Qwen3-8b, Zero-shot protocol=true2025.12 | 78.71 | |
| Qwen 2.5-7BApproach=CoT, Learning Paradigm=Vanilla2024.11 | 78.4 | |
| AGDOTraining Stage=RL2026.06 | 78.3 | |
| AGDO-SFTTraining Stage=SFT2026.06 | 78.1 | |
| AutoLoRAModel Selection=AutoLoRA, Data Selection=Diversity2026.02 | 78 | |
| AutoLoRAModel Selection=AutoLoRA, Data Selection=IF2026.02 | 77.9 | |
| Qwen 2.5-7BApproach=LoRA, Learning Paradigm=Fine-tuned2024.11 | 77.5 | |
| DefaultModel Selection=Default, Data Selection=Diversity2026.02 | 77.4 | |
| FULLModel=Llama3-8b, Zero-shot protocol=true2025.12 | 77.23 | |
| RoBoTModel Selection=RoBoT, Data Selection=DoReMi2026.02 | 77.1 | |
| Entropy Equilibrium Sampling (EES)LM=Llama3.1-8B, tau=Avg2025.11 | 77.02 | |
| BOModel Selection=BO, Data Selection=DoReMi2026.02 | 77 | |
| LLaMA-3.1-8BApproach=Planning-token, Learning Paradigm=Fine-tuned2024.11 | 76.9 | |
| LLaMA-3.1-70BApproach=Zero-shot, Learning Paradigm=Vanilla2024.11 | 76.5 | |
| DefaultModel Selection=Default, Data Selection=Default2026.02 | 76.3 | |
| DARTSModel Selection=DARTS, Data Selection=LESS2026.02 | 76.3 | |
| RoBoTModel Selection=RoBoT, Data Selection=Diversity2026.02 | 76.3 | |
| UnifiedQAseen_dataset_during_training=false, training_format=multi-format2020.05 | 76.2 | |
| DARTSModel Selection=DARTS, Data Selection=DoReMi2026.02 | 76.1 | |
| AutoLoRAModel Selection=AutoLoRA, Data Selection=DoReMi2026.02 | 76.1 | |
| UnifiedQA [MC]seen_dataset_during_training=false, training_format=multiple choice2020.05 | 75.9 | |
| RoBoTModel Selection=RoBoT, Data Selection=LESS2026.02 | 75.5 | |
| SFTTraining Stage=SFT2026.06 | 75.5 | |
| LLaMA-3.1-8BApproach=LoRA, Learning Paradigm=Fine-tuned2024.11 | 75.4 | |
| Temperature SamplingLM=Llama3.1-8B, tau=Avg2025.11 | 75.34 | |
| KALEBackbone=Qwen2.5 32B, Category=Augmented-based2026.01 | 75.02 | |
| ExpGraphBackbone Model=Llama-3.1-8B-Instruct (Large LLM), Method Category=LLM-Centric Experience Learning Baselines2026.05 | 75 | |
| RoBoTModel Selection=RoBoT, Data Selection=Default2026.02 | 74.9 | |
| TEALModel=Qwen3-8b, Zero-shot protocol=true2025.12 | 74.77 | |
| SPONModel=Qwen3-8b, Zero-shot protocol=true2025.12 | 74.28 | |
| DefaultModel Selection=Default, Data Selection=DoReMi2026.02 | 74.2 | |
| DARTSModel Selection=DARTS, Data Selection=IF2026.02 | 73.7 | |
| DefaultModel Selection=Default, Data Selection=LESS2026.02 | 73 | |
| Blockwise SFTTraining Stage=SFT2026.06 | 72.9 | |
| Roberta-largeEvaluation Protocol=fine-tuned, Backbone=Roberta-large2026.06 | 72.1 | |
| MTO-MAPFull name=Masked Answer Prompting, Backbone=T5-large2026.06 | 71.74 | |
| BaseModel=LLaMA-3.1-8B, Compression=0%, Mode=Zero-shot2025.10 | 71.66 | |
| StructGPTBackbone=Qwen2.5 32B, Category=Retrieval-based2026.01 | 71.58 | |
| MTO-D+MCPFull name=Masked Choice Prompting with a Denoising objective, Backbone=T5-large2026.06 | 71.58 | |
| SDFTBackbone=Qwen2.5 32B, Category=SFT-based2026.01 | 71.25 | |
| T5-largeEvaluation Protocol=fine-tuned, Backbone=T5-large, Settings=using our settings2026.06 | 71.25 | |
| LLaMA-2-7BApproach=Ours, Learning Paradigm=Fine-tuned2024.11 | 71.1 | |
| LLaMA-3.1-8BApproach=CoT, Learning Paradigm=Vanilla2024.11 | 70.6 | |
| DMTBackbone=Qwen2.5 32B, Category=SFT-based2026.01 | 70.43 | |
| BaselineBit width (b)=16.002025.05 | 70.2 | |
| KG-SFTBackbone=Qwen2.5 32B, Category=SFT-based2026.01 | 69.62 |