General Knowledge Reasoning on MMLU-Pro (Accuracy, Token Consumption)
75.6AccuracySFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SFTBackbone=LLaMA-3.1 8B Instruct, Evaluation Method=SFT2026.04 | 75.6 | 1,447.46 | |
| DebateBackbone=LLaMA-3.1 8B Instruct, Evaluation Method=Debate2026.04 | 64.6 | 8,705.32 | |
| IMAD (SFT+RL)Backbone=LLaMA-3.1 8B Instruct, Evaluation Method=IMAD (SFT+RL)2026.04 | 62 | 728.07 | |
| SingleBackbone=LLaMA-3.1 8B Instruct, Evaluation Method=Single2026.04 | 61.1 | 637.89 | |
| DebateGPTBackbone=LLaMA-3.1 8B Instruct, Evaluation Method=DebateGPT2026.04 | 60.58 | 1,023.17 | |
| DebateBackbone=Qwen 2.5 7B Instruct, Evaluation Method=Debate2026.04 | 57.67 | 5,367.9 | |
| DebateGPTBackbone=Qwen 2.5 7B Instruct, Evaluation Method=DebateGPT2026.04 | 54.1 | 636.24 | |
| IMAD (SFT+RL)Backbone=Qwen 2.5 7B Instruct, Evaluation Method=IMAD (SFT+RL)2026.04 | 52.87 | 660.42 | |
| SFTBackbone=Qwen 2.5 7B Instruct, Evaluation Method=SFT2026.04 | 50.6 | 1,162.36 | |
| SingleBackbone=Qwen 2.5 7B Instruct, Evaluation Method=Single2026.04 | 48.87 | 912.01 | |
| DebateBackbone=Mistral Nemo 12B Instruct, Evaluation Method=Debate2026.04 | 41.3 | 3,856.81 | |
| DebateGPTBackbone=Mistral Nemo 12B Instruct, Evaluation Method=DebateGPT2026.04 | 40.4 | 464.52 | |
| SingleBackbone=Mistral Nemo 12B Instruct, Evaluation Method=Single2026.04 | 39.17 | 541.89 | |
| IMAD (SFT+RL)Backbone=Mistral Nemo 12B Instruct, Evaluation Method=IMAD (SFT+RL)2026.04 | 38.97 | 565.21 | |
| SFTBackbone=Mistral Nemo 12B Instruct, Evaluation Method=SFT2026.04 | 36.2 | 1,109.93 |