Multi-task Knowledge Understanding on MMLU-Pro
59.64Mean AccuracyPolicyAlign
Evaluation Results
| Method | Links | |
|---|---|---|
| PolicyAlignBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 59.64 | |
| BaseBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Base2026.06 | 59.28 | |
| NSPOBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 58.74 | |
| ICLBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 58.52 | |
| GRPO+PolicyBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 58.44 | |
| AlphaAlignBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 58.07 | |
| SFTBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 53.24 | |
| BaseBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Base2026.06 | 51.7 | |
| ICLBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 51.61 | |
| PolicyAlignBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 51.25 | |
| NSPOBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 50.86 | |
| GRPO+PolicyBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 50.69 | |
| AlphaAlignBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 48.37 | |
| SFTBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 45.95 | |
| OPDTraining Budget=sufficient, Rollout=full, Zero-shot=true2026.02 | 41.3 | |
| OPD (prefix scheduling)Training Budget=sufficient, Zero-shot=true2026.02 | 39.4 | |
| AceMADBase Model=Qwen3-235B-A22B-Instruct, Iteration Rounds (T)=5, Number of Agents (N)=52026.03 | 36.54 | |
| Single AgentBase Model=Qwen3-235B-A22B-Instruct, Number of Agents (N)=52026.03 | 35.93 | |
| ICLBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 32.21 | |
| PolicyAlignBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 31.43 | |
| GRPO+PolicyBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 31.27 | |
| BaseBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Base2026.06 | 31.07 | |
| NSPOBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 30.87 | |
| OPDSteps=10, Training Budget=limited, Zero-shot=true2026.02 | 30.7 | |
| AlphaAlignBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 29.88 | |
| SeqKDTraining Budget=sufficient, Zero-shot=true2026.02 | 29.6 | |
| Decentralized MADBase Model=Qwen3-235B-A22B-Instruct, Number of Agents (N)=52026.03 | 28.9 | |
| SeqKDSteps=300, Training Budget=limited, Zero-shot=true2026.02 | 28.5 | |
| SFTBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 28.22 | |
| AceMADBase Model=Qwen3-235B-A22B-Instruct, Iteration Rounds (T)=3, Number of Agents (N)=52026.03 | 27.06 | |
| Centralized MADBase Model=Qwen3-235B-A22B-Instruct, Number of Agents (N)=52026.03 | 24.01 | |
| AceMADBase Model=Qwen3-235B-A22B-Instruct, Iteration Rounds (T)=2, Number of Agents (N)=52026.03 | 14.37 | |
| Majority VotingBase Model=Qwen3-235B-A22B-Instruct, Number of Agents (N)=52026.03 | 14.07 | |
| Sparse MADBase Model=Qwen3-235B-A22B-Instruct, Number of Agents (N)=52026.03 | 13.91 | |
| OPDPrefix Length=2048, Training Budget=limited, Zero-shot=true2026.02 | 12 | |
| Qwen3-1.7B-BaseZero-shot=true2026.02 | 9.1 | |
| Centralized MADBase Model=GPT-4o-mini, Number of Agents (N)=52026.03 | 8.72 | |
| Sparse MADBase Model=GPT-4o-mini, Number of Agents (N)=52026.03 | 8.72 | |
| AceMADBase Model=GPT-4o-mini, Iteration Rounds (T)=3, Number of Agents (N)=52026.03 | 8.72 | |
| AceMADBase Model=GPT-4o-mini, Iteration Rounds (T)=2, Number of Agents (N)=52026.03 | 8.1 | |
| AceMADBase Model=GPT-4o-mini, Iteration Rounds (T)=5, Number of Agents (N)=52026.03 | 7.95 | |
| Decentralized MADBase Model=GPT-4o-mini, Number of Agents (N)=52026.03 | 6.88 | |
| Single AgentBase Model=GPT-4o-mini, Number of Agents (N)=52026.03 | 6.42 | |
| Majority VotingBase Model=GPT-4o-mini, Number of Agents (N)=52026.03 | 5.5 | |
| OPDPrefix Length=1024, Training Budget=limited, Zero-shot=true2026.02 | 1.9 | |
| OPDPrefix Length=256, Training Budget=limited, Zero-shot=true2026.02 | 1.5 | |
| OPDPrefix Length=512, Training Budget=limited, Zero-shot=true2026.02 | 1 |