General Knowledge Reasoning on MMLU High
67.2AccuracyReason, Reward, Refine
Evaluation Results
| Method | Links | |
|---|---|---|
| Reason, Reward, RefineModel=LLaMA 3.2 3B2026.07 | 67.2 | |
| Reason, Reward, RefineModel=Phi 3.5 Mini 3.8B2026.07 | 65.83 | |
| RAGModel=Phi 3.5 Mini 3.8B2026.07 | 60.53 | |
| RAGModel=Qwen 2.5 1.5B2026.07 | 59.41 | |
| DPOModel=Phi 3.5 Mini 3.8B2026.07 | 56.12 | |
| SFTModel=Phi 3.5 Mini 3.8B2026.07 | 55.97 | |
| Reason, Reward, RefineModel=LLaMA 3.2 1B2026.07 | 55.29 | |
| RAGModel=LLaMA 3.2 3B2026.07 | 55.29 | |
| CoTModel=Phi 3.5 Mini 3.8B2026.07 | 55.17 | |
| Reason, Reward, RefineModel=Qwen 2.5 1.5B2026.07 | 55.03 | |
| CoTModel=LLaMA 3.2 3B2026.07 | 50 | |
| SFTModel=LLaMA 3.2 3B2026.07 | 48.29 | |
| DPOModel=LLaMA 3.2 3B2026.07 | 47.65 | |
| CoTModel=Qwen 2.5 1.5B2026.07 | 47.05 | |
| DPOModel=Qwen 2.5 1.5B2026.07 | 46.47 | |
| SFTModel=LLaMA 3.2 1B2026.07 | 42.35 | |
| SFTModel=Qwen 2.5 1.5B2026.07 | 41.18 | |
| DPOModel=LLaMA 3.2 1B2026.07 | 39.41 | |
| RAGModel=LLaMA 3.2 1B2026.07 | 38.02 | |
| CoTModel=LLaMA 3.2 1B2026.07 | 30.58 |