General Knowledge on HellaSwag
91.7AccuracyJoyAI-LLM Flash
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| JoyAI-LLM Flash#Token=<1002026.04 | 91.7 | — | — | — | |
| Qwen3.5-35B-A3B#Token=<1002026.04 | 89.1 | — | — | — | |
| Qwen3-Next-80B-A3B#Token=<1002026.04 | 88.1 | — | — | — | |
| Qwen3-30B-A3B#Token=<1002026.04 | 86.2 | — | — | — | |
| VSBToken budget=10, Number of shots=0, Backbone=LLaDA-1.52026.04 | 76.93 | — | — | — | |
| VSBToken budget=10, Number of shots=0, Backbone=LLaDA-8B2026.04 | 76.68 | — | — | — | |
| DAEDALToken budget=10, Number of shots=02026.04 | 75.6 | — | — | — | |
| AdaBlockToken budget=10, Number of shots=02026.04 | 73.94 | — | — | — | |
| D2FToken budget=10, Number of shots=02026.04 | 73.33 | — | — | — | |
| Blockwise-SFTToken budget=10, Number of shots=02026.04 | 73.1 | — | — | — | |
| LLaDA-8BToken budget=10, Number of shots=02026.04 | 72.74 | — | — | — | |
| LLaDA-1.5Token budget=10, Number of shots=02026.04 | 72.34 | — | — | — | |
| OriginalBase Model=Ministral-8B-Instruct-24102025.09 | 71.9 | — | — | — | |
| GLM-4.7-Flash-T#Token=30002026.04 | 71.5 | — | — | — | |
| dLLM-VarToken budget=10, Number of shots=02026.04 | 71.48 | — | — | — | |
| Qwen3-1.7BModel Size=1.7B, Architecture=Standard, Few-shot setting=0-shot, Max tokens=327682026.02 | 59.4 | — | — | — | |
| Qwen3-1.7B-ALLMEMModel Size=1.7B, Architecture=ALLMEM, Sliding window length=2048, Attention sinks=128, Few-shot setting=0-shot, Max tokens=327682026.02 | 59.4 | — | — | — | |
| SAM+NPOBase Model=Ministral-8B-Instruct-24102025.09 | 57 | 53 | 72.1 | 2 | |
| GAGDRBase Model=Ministral-8B-Instruct-24102025.09 | 56.6 | 92.1 | 52.8 | 4 | |
| Task VectorBase Model=Ministral-8B-Instruct-24102025.09 | 56.1 | 100 | 0 | 8 | |
| PRISMBase Model=Ministral-8B-Instruct-24102025.09 | 54.6 | 73.2 | 76.1 | 1 | |
| DOORBase Model=Ministral-8B-Instruct-24102025.09 | 53 | 98.5 | 28.9 | 5 | |
| NPOGDRBase Model=Ministral-8B-Instruct-24102025.09 | 51.3 | 80.6 | 55.6 | 3 | |
| Qwen3-0.6B-ALLMEMModel Size=0.6B, Architecture=ALLMEM, Sliding window length=2048, Attention sinks=128, Few-shot setting=0-shot, Max tokens=327682026.02 | 41.4 | — | — | — | |
| Qwen3-0.6BModel Size=0.6B, Architecture=Standard, Few-shot setting=0-shot, Max tokens=327682026.02 | 40.8 | — | — | — | |
| NPOBase Model=Ministral-8B-Instruct-24102025.09 | 25.8 | 0.3 | 5.5 | 6 | |
| GABase Model=Ministral-8B-Instruct-24102025.09 | 25.7 | 0 | 0 | 7 | |
| ChatUse Sens=false, Backbone=Mistral-7B2025.02 | 0.6597 | — | — | — | |
| Task ArithmeticUse Sens=true, Backbone=Mistral-7B2025.02 | 0.6194 | — | — | — | |
| DAREUse Sens=true, Backbone=Mistral-7B2025.02 | 0.5892 | — | — | — | |
| MathUse Sens=false, Backbone=Mistral-7B2025.02 | 0.5868 | — | — | — | |
| Ties-MergingUse Sens=true, Backbone=Mistral-7B2025.02 | 0.5794 | — | — | — | |
| Ties-MergingUse Sens=false, Backbone=Mistral-7B2025.02 | 0.5759 | — | — | — | |
| DAREUse Sens=false, Backbone=Mistral-7B2025.02 | 0.5577 | — | — | — | |
| CodeUse Sens=false, Backbone=Mistral-7B2025.02 | 0.5319 | — | — | — | |
| Task ArithmeticUse Sens=false, Backbone=Mistral-7B2025.02 | 0.468 | — | — | — |