General Knowledge Question Answering on MMLU
82.06AccuracyIoT
Evaluation Results
| Method | Links | |
|---|---|---|
| IoTModel=GPT-4o mini2026.03 | 82.06 | |
| CoTModel=GPT-4o mini2026.03 | 81.31 | |
| QWEN-2.5-7BBackbone=QWEN-2.5-7B2026.05 | 79.7 | |
| Ellipsoid ControlBackbone=QWEN-2.5-7B2026.05 | 79.4 | |
| LoRA-SteerBackbone=QWEN-2.5-7B2026.05 | 78.8 | |
| PGD-SphereBackbone=QWEN-2.5-7B2026.05 | 78.4 | |
| HSFBackbone=QWEN-2.5-7B2026.05 | 78 | |
| Jailbreak AntidoteBackbone=QWEN-2.5-7B2026.05 | 76.5 | |
| IoTModel=Olmo-2-13B2026.03 | 71.34 | |
| CoTModel=Olmo-2-13B2026.03 | 70.59 | |
| SCModel=Olmo-2-13B2026.03 | 69.86 | |
| EoTModel=Olmo-2-13B2026.03 | 69.62 | |
| SCModel=Llama-3.3-8B2026.03 | 69 | |
| LLAMA3-8BBackbone=LLAMA3-8B2026.05 | 68.5 | |
| Circuit BreakerBackbone=LLAMA3-8B2026.05 | 68.3 | |
| Ellipsoid ControlBackbone=LLAMA3-8B2026.05 | 68.3 | |
| HSFBackbone=LLAMA3-8B2026.05 | 68.2 | |
| Jailbreak AntidoteBackbone=LLAMA3-8B2026.05 | 67.8 | |
| IoTModel=Olmo-2-7B2026.03 | 66.78 | |
| EoTModel=Llama-3.3-8B2026.03 | 66.56 | |
| IoTModel=Llama-3.3-8B2026.03 | 66.31 | |
| CoTModel=Olmo-2-7B2026.03 | 65.62 | |
| Mistral-7B-v2Backbone=Mistral-7B-v22026.05 | 65.6 | |
| Circuit BreakerBackbone=Mistral-7B-v22026.05 | 65.6 | |
| CoTModel=Llama-3.3-8B2026.03 | 65.56 | |
| Ellipsoid ControlBackbone=Mistral-7B-v22026.05 | 65.5 | |
| LoRA-SteerBackbone=Mistral-7B-v22026.05 | 65.4 | |
| HSFBackbone=Mistral-7B-v22026.05 | 65 | |
| SCModel=Olmo-2-7B2026.03 | 64.91 | |
| PGD-SphereBackbone=Mistral-7B-v22026.05 | 64.5 | |
| Jailbreak AntidoteBackbone=Mistral-7B-v22026.05 | 64.3 | |
| EoTModel=Olmo-2-7B2026.03 | 62.62 | |
| ME-DLM Stage 3Budget=1/1, Evaluation Protocol=fully generative2026.05 | 62.6 | |
| LoTVerifier Training Dataset=AQuA2025.03 | 62.3 | |
| ME-DLM Stage 3Budget=1/2, Evaluation Protocol=fully generative2026.05 | 61.5 | |
| ME-DLM Stage 2Budget=1/1, Evaluation Protocol=fully generative2026.05 | 60.6 | |
| LLaDABudget=1/1, Evaluation Protocol=fully generative2026.05 | 60.2 | |
| ME-DLM Stage 3Budget=1/4, Evaluation Protocol=fully generative2026.05 | 58.5 | |
| LoRA-SteerBackbone=LLAMA3-8B2026.05 | 58.3 | |
| ME-DLM Stage 2Budget=1/2, Evaluation Protocol=fully generative2026.05 | 57.7 | |
| LLaDABudget=1/2, Evaluation Protocol=fully generative2026.05 | 57.1 | |
| ME-DLM Stage 3Budget=1/8, Evaluation Protocol=fully generative2026.05 | 56.2 | |
| LoTVerifier Training Dataset=MMLU2025.03 | 53 | |
| LoTVerifier Training Dataset=CommonSenseQA2025.03 | 53 | |
| LLaDABudget=1/4, Evaluation Protocol=fully generative2026.05 | 44.5 | |
| ME-DLM Stage 2Budget=1/4, Evaluation Protocol=fully generative2026.05 | 43.3 | |
| LoTVerifier Training Dataset=StrategyQA2025.03 | 40.5 | |
| PGD-SphereBackbone=LLAMA3-8B2026.05 | 27.4 | |
| LLaDABudget=1/8, Evaluation Protocol=fully generative2026.05 | 23.4 | |
| ME-DLM Stage 2Budget=1/8, Evaluation Protocol=fully generative2026.05 | 21.7 |