Common Sense Reasoning on Hellaswag
93.87AccuracyFlexora
Evaluation Results
| Method | Links | |
|---|---|---|
| FlexoraLoRA Rank (r)=322024.08 | 93.87 | |
| FlexoraLoRA Rank (r)=162024.08 | 93.71 | |
| FlexoraLoRA Rank (r)=82024.08 | 93.62 | |
| FlexoraFine-tuning Strategy=LoRA, Enhanced=Flexora2024.08 | 93.62 | |
| Flexora(w/ Base Model)Backbone=Meta-Llama-3-8B, Model variant=Base, Adaptation=Flexora2024.08 | 93.62 | |
| Flexora(w/ Instruct Model)Backbone=Meta-Llama-3-8B-Instruct, Model variant=Instruct, Adaptation=Flexora2024.08 | 93.53 | |
| SDAR-30B-A3Bgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 92.81 | |
| LoRA-dropLoRA Rank (r)=82024.08 | 91.86 | |
| FlexoraFine-tuning Strategy=Full Fine-Tuning, Enhanced=Flexora2024.08 | 91.32 | |
| Random (Greedy)Selection=randomly selected layers, LoRA Rank (r)=82024.08 | 91.15 | |
| VeRALoRA Rank (r)=82024.08 | 90.98 | |
| Full FTFine-tuning protocol=full parameter fine-tuning2024.08 | 90.53 | |
| Full FTFine-tuning Strategy=Full Fine-Tuning2024.08 | 90.53 | |
| AdaLoRAro=4, LoRA Rank (r)=82024.08 | 90.17 | |
| LoRALoRA Rank (r)=322024.08 | 90.01 | |
| LoRALoRA Rank (r)=162024.08 | 89.99 | |
| LoRALoRA Rank (r)=82024.08 | 89.72 | |
| LoRAFine-tuning Strategy=LoRA2024.08 | 89.72 | |
| Instruct ModelBackbone=Meta-Llama-3-8B-Instruct, Model variant=Instruct2024.08 | 89.38 | |
| LoRA-SPLoRA Rank (r)=82024.08 | 89.37 | |
| LoRA-FALoRA Rank (r)=82024.08 | 89.16 | |
| LoRAPruneRatio=0.5, LoRA Rank (r)=82024.08 | 88.42 | |
| Qwen-3-30B-A3BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 88.2 | |
| SDAR-8B-Chatgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 87.59 | |
| Qwen-3-32BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 87.4 | |
| Qwen-3-14BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 86.7 | |
| Evo 8BPost-training=SFT, Number of shots=02026.02 | 86.4 | |
| Llama-3.3-70BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 86.3 | |
| LFPO (All Loss)Base Model=LLaDA 8B, Training Algorithm=LFPO (All Loss)2026.03 | 85.7 | |
| AGRPOBase Model=LLaDA 8B, Training Algorithm=AGRPO2026.03 | 85.1 | |
| BD3-LM 7BPost-training=SFT+RL, Number of shots=02026.02 | 84.8 | |
| Gemma-3-27BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 84.5 | |
| FP16Model=Qwen2.5-14B2026.03 | 84.34 | |
| LFPO (Neg. Only)Base Model=LLaDA 8B, Training Algorithm=LFPO (Neg. Only)2026.03 | 84.3 | |
| LFPO (Pos. Only)Base Model=LLaDA 8B, Training Algorithm=LFPO (Pos. Only)2026.03 | 84.2 | |
| Mistral-3.2-24BOpenness=Open-weights, Regional Origin=European, Post-training=Instruction-tuned2026.02 | 84 | |
| Gemma-3-12BOpenness=Open-weights, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 83.2 | |
| SPGBase Model=LLaDA 8B, Training Algorithm=SPG2026.03 | 83.1 | |
| coupled-GRPOBase Model=LLaDA 8B, Training Algorithm=coupled-GRPO2026.03 | 82.5 | |
| LLaDA2.0-minigeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 82.35 | |
| UniGRPOBase Model=LLaDA 8B, Training Algorithm=UniGRPO2026.03 | 82.3 | |
| FP16Model=Llama-2-13B2026.03 | 82.22 | |
| Qwen2.5 7BPost-training=SFT+RL, Number of shots=02026.02 | 82.2 | |
| FP16Backbone=Llama-3.1-8B2026.03 | 81.97 | |
| FP16Backbone=Qwen2.5-7B2026.03 | 80.22 | |
| diffu-GRPOBase Model=LLaDA 8B, Training Algorithm=diffu-GRPO2026.03 | 80.1 | |
| Llama-2#Param=6.9B, Training Tokens=2T, Shots=10-shot2024.10 | 78.6 | |
| LLaDA2.1-minigeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 78 | |
| NSDSModel=Qwen2.5-14B2026.03 | 77.34 | |
| DIRBackbone=Llama3.1-8B-Instruct2025.12 | 77.33 | |
| BaseBase Model=Llama3.1-8B-Instruct, Evaluation Protocol=0-shot2026.02 | 77.21 | |
| ALBMBase Model=Llama3.1-8B-Instruct, Evaluation Protocol=0-shot2026.02 | 77.21 | |
| BaseBackbone=Llama3.1-8B-Instruct2025.12 | 77.21 | |
| ALBMBackbone=Llama3.1-8B-Instruct2025.12 | 77.21 | |
| PoEBase Model=Llama3.1-8B-Instruct, Evaluation Protocol=0-shot2026.02 | 77.08 | |
| PoEBackbone=Llama3.1-8B-Instruct2025.12 | 77.08 | |
| NSDSModel=Llama-2-13B2026.03 | 76.86 | |
| InfoRMBase Model=Llama3.1-8B-Instruct, Evaluation Protocol=0-shot2026.02 | 76.78 | |
| InfoRMBackbone=Llama3.1-8B-Instruct2025.12 | 76.78 | |
| KurtosisModel=Qwen2.5-14B2026.03 | 76.58 | |
| ZDModel=Qwen2.5-14B2026.03 | 76.49 | |
| SKBase Model=Llama3.1-8B-Instruct, Evaluation Protocol=0-shot2026.02 | 76.42 | |
| SKBackbone=Llama3.1-8B-Instruct2025.12 | 76.42 | |
| KurtBoostModel=Llama-2-13B2026.03 | 75.95 | |
| OLMo-3.1-32BOpenness=Fully-open, Regional Origin=Non-European, Post-training=Instruction-tuned2026.02 | 75.8 | |
| LLaMA3 8BPost-training=SFT+RL, Number of shots=02026.02 | 75.5 | |
| MSEModel=Qwen2.5-14B2026.03 | 75.37 | |
| LLaDA-8B-Instructgeneration length=optimal, block length=optimal, denoising steps=optimal2026.04 | 75.3 | |
| EWQModel=Llama-2-13B2026.03 | 75.11 | |
| SKBase Model=OpenRLHF-Llama3-8B-SFT, Evaluation Protocol=0-shot2026.02 | 74.76 | |
| SKBackbone=OpenRLHF-Llama3-8B-SFT2025.12 | 74.76 | |
| BNRMBase Model=Llama3.1-8B-Instruct, Evaluation Protocol=0-shot2026.02 | 74.66 | |
| ALBMBase Model=OpenRLHF-Llama3-8B-SFT, Evaluation Protocol=0-shot2026.02 | 74.63 | |
| ALBMBackbone=OpenRLHF-Llama3-8B-SFT2025.12 | 74.63 | |
| Apertus-70BOpenness=Fully-open, Regional Origin=European, Post-training=Instruction-tuned2026.02 | 74.6 | |
| LLaDA 8BPost-training=SFT, Number of shots=02026.02 | 74.6 | |
| DIRBackbone=OpenRLHF-Llama3-8B-SFT2025.12 | 74.52 | |
| EWQModel=Qwen2.5-14B2026.03 | 74.52 | |
| ZDModel=Llama-2-13B2026.03 | 74.34 | |
| MSEModel=Llama-2-13B2026.03 | 73.27 | |
| LPBase Model=Llama3.1-8B-Instruct, Evaluation Protocol=0-shot2026.02 | 73.15 | |
| LPBackbone=Llama3.1-8B-Instruct2025.12 | 73.15 | |
| BaseBase Model=OpenRLHF-Llama3-8B-SFT, Evaluation Protocol=0-shot2026.02 | 72.51 | |
| PoEBase Model=OpenRLHF-Llama3-8B-SFT, Evaluation Protocol=0-shot2026.02 | 72.51 | |
| LPBase Model=OpenRLHF-Llama3-8B-SFT, Evaluation Protocol=0-shot2026.02 | 72.51 | |
| BaseBackbone=OpenRLHF-Llama3-8B-SFT2025.12 | 72.51 | |
| PoEBackbone=OpenRLHF-Llama3-8B-SFT2025.12 | 72.51 | |
| LPBackbone=OpenRLHF-Llama3-8B-SFT2025.12 | 72.51 | |
| InfoRMBase Model=OpenRLHF-Llama3-8B-SFT, Evaluation Protocol=0-shot2026.02 | 72.12 | |
| InfoRMBackbone=OpenRLHF-Llama3-8B-SFT2025.12 | 72.12 | |
| NSDSBackbone=Qwen2.5-7B2026.03 | 71.56 | |
| Sheared-Llama#Param=2.7B, Training Tokens=50B, Shots=10-shot2024.10 | 70.8 | |
| ZDBackbone=Qwen2.5-7B2026.03 | 70.45 | |
| LLaDA 8BBase Model=LLaDA 8B, Training Algorithm=None2026.03 | 70.3 | |
| KurtBoostBackbone=Qwen2.5-7B2026.03 | 69.92 | |
| EuroLLM-22BOpenness=Fully-open, Regional Origin=European, Post-training=Instruction-tuned2026.02 | 69.7 | |
| NSDSBackbone=Llama-3.1-8B2026.03 | 69.67 | |
| Read-ME#Param=4.7B-17B, Training Tokens=1B, Shots=10-shot2024.10 | 68.5 | |
| KurtBoostBackbone=Llama-3.1-8B2026.03 | 68.22 | |
| ARMADALoss Function=L_cosine, Teacher Model=Stable Diffusion, Student Model=LLaMA-7B, Zero-shot=true2026.03 | 67.8 |