Code Generation on LiveCodeBench (Pass@1)
95.8Pass@1ExPairT-LLM
Evaluation Results
| Method | Links | |
|---|---|---|
| ExPairT-LLMModel=OpenAI o1-mini2025.11 | 95.8 | |
| ExPairT-LLMModel=Gemini 2.5 Flash2025.11 | 92.9 | |
| ExPairT-LLMModel=DeepSeek-R12025.11 | 88.4 | |
| OriginalModel=Gemini 2.5 Flash2025.11 | 71.4 | |
| OriginalModel=OpenAI o1-mini2025.11 | 66.7 | |
| OriginalModel=DeepSeek-R12025.11 | 55.7 | |
| GLM-5 BaseArchitecture=MoE, Activated Params=40B, Total Params=744B2026.02 | 34.4 | |
| IOA (Ours)Model=Qwen2.5-7B2026.02 | 32.2 | |
| ReasoningBackbone=Qwen2.5-7B family2026.01 | 30.3 | |
| DistiLLM-2Model=Qwen2.5-7B2026.02 | 28.93 | |
| GLM-4.5 BaseArchitecture=MoE, Activated Params=32B, Total Params=355B2026.02 | 28.1 | |
| IOAStudent Model=Qwen2.5-3B, Teacher Model=DeepSeek-R12026.02 | 27.73 | |
| IOAStudent Model=LLaMA3.1-8B, Teacher LLM=DeepSeek-R12026.02 | 27.68 | |
| IOAModel=Qwen2.5-3B, Teacher LLM=OpenAI o12026.02 | 26.94 | |
| ReasonAnyBackbone=Qwen2.5-7B family2026.01 | 26.48 | |
| GKDModel=Qwen2.5-7B2026.02 | 26.46 | |
| Kimi-K2 BaseArchitecture=MoE, Activated Params=32B, Total Params=1043B2026.02 | 26.3 | |
| POCLModel=Qwen2.5-7B2026.02 | 26.14 | |
| ABKDModel=Qwen2.5-7B2026.02 | 25.04 | |
| SuperCorrectModel=Qwen2.5-7B2026.02 | 24.99 | |
| IOAStudent Model=LLaMA3.2-3B, Teacher Model=DeepSeek-R12026.02 | 24.88 | |
| DeepSeek-V3 BaseArchitecture=MoE, Activated Params=37B, Total Params=671B2026.02 | 24.6 | |
| IOAModel=LLaMA3.2-3B, Teacher LLM=OpenAI o12026.02 | 24.08 | |
| MADAStudent Model=Qwen2.5-3B, Teacher Model=DeepSeek-R12026.02 | 23.84 | |
| Star-AgentsStudent Model=Qwen2.5-3B, Teacher Model=DeepSeek-R12026.02 | 23.14 | |
| MADAModel=Qwen2.5-3B, Teacher LLM=OpenAI o12026.02 | 23.06 | |
| Star-AgentsModel=Qwen2.5-3B, Teacher LLM=OpenAI o12026.02 | 22.53 | |
| CasCoDStudent Model=Qwen2.5-3B, Teacher Model=DeepSeek-R12026.02 | 22.25 | |
| CounterDistillStudent Model=Qwen2.5-3B, Teacher Model=DeepSeek-R12026.02 | 21.82 | |
| CasCoDModel=Qwen2.5-3B, Teacher LLM=OpenAI o12026.02 | 21.64 | |
| DSSStudent Model=Qwen2.5-3B, Teacher Model=DeepSeek-R12026.02 | 21.41 | |
| CounterDistillModel=Qwen2.5-3B, Teacher LLM=OpenAI o12026.02 | 21.29 | |
| MADAStudent Model=LLaMA3.2-3B, Teacher Model=DeepSeek-R12026.02 | 21.28 | |
| MADAModel=LLaMA3.2-3B, Teacher LLM=OpenAI o12026.02 | 21.02 | |
| Star-AgentsStudent Model=LLaMA3.2-3B, Teacher Model=DeepSeek-R12026.02 | 20.92 | |
| DSSModel=Qwen2.5-3B, Teacher LLM=OpenAI o12026.02 | 20.85 | |
| Star-AgentsModel=LLaMA3.2-3B, Teacher LLM=OpenAI o12026.02 | 20.61 | |
| CasCoDStudent Model=LLaMA3.2-3B, Teacher Model=DeepSeek-R12026.02 | 20.27 | |
| LionStudent Model=Qwen2.5-3B, Teacher Model=DeepSeek-R12026.02 | 20.23 | |
| CounterDistillStudent Model=LLaMA3.2-3B, Teacher Model=DeepSeek-R12026.02 | 20.03 | |
| CasCoDModel=LLaMA3.2-3B, Teacher LLM=OpenAI o12026.02 | 19.94 | |
| LionModel=Qwen2.5-3B, Teacher LLM=OpenAI o12026.02 | 19.74 | |
| DSSStudent Model=LLaMA3.2-3B, Teacher Model=DeepSeek-R12026.02 | 19.64 | |
| CounterDistillModel=LLaMA3.2-3B, Teacher LLM=OpenAI o12026.02 | 19.63 | |
| LEDBackbone=Qwen2.5-7B family2026.01 | 19.27 | |
| DSSModel=LLaMA3.2-3B, Teacher LLM=OpenAI o12026.02 | 19.26 | |
| LionStudent Model=LLaMA3.2-3B, Teacher Model=DeepSeek-R12026.02 | 18.54 | |
| LionModel=LLaMA3.2-3B, Teacher LLM=OpenAI o12026.02 | 18.16 | |
| LinearBackbone=Qwen2.5-7B family2026.01 | 17.45 | |
| LaMiniStudent Model=Qwen2.5-3B, Teacher Model=DeepSeek-R12026.02 | 17.43 | |
| LaMiniModel=Qwen2.5-3B, Teacher LLM=OpenAI o12026.02 | 17.42 | |
| Self-InstructStudent Model=Qwen2.5-3B, Teacher Model=DeepSeek-R12026.02 | 16.86 | |
| Self-InstructModel=Qwen2.5-3B, Teacher LLM=OpenAI o12026.02 | 16.84 | |
| LaMiniModel=LLaMA3.2-3B, Teacher LLM=OpenAI o12026.02 | 15.92 | |
| LaMiniStudent Model=LLaMA3.2-3B, Teacher Model=DeepSeek-R12026.02 | 15.91 | |
| Self-InstructModel=LLaMA3.2-3B, Teacher LLM=OpenAI o12026.02 | 15.25 | |
| Self-InstructStudent Model=LLaMA3.2-3B, Teacher Model=DeepSeek-R12026.02 | 15.24 | |
| UndistilledStudent Model=Qwen2.5-3B, Teacher Model=None2026.02 | 14.73 | |
| UndistilledModel=Qwen2.5-3B, Teacher LLM=OpenAI o12026.02 | 14.72 | |
| UndistilledModel=LLaMA3.2-3B, Teacher LLM=OpenAI o12026.02 | 13.24 | |
| UndistilledStudent Model=LLaMA3.2-3B, Teacher Model=None2026.02 | 13.21 | |
| FinanceBackbone=Qwen2.5-7B family2026.01 | 2.88 | |
| Task ArithmeticBackbone=Qwen2.5-7B family2026.01 | 1.44 | |
| FuseLLMBackbone=Qwen2.5-7B family2026.01 | 0.76 | |
| TIESBackbone=Qwen2.5-7B family2026.01 | 0.38 | |
| DAREBackbone=Qwen2.5-7B family2026.01 | 0.38 | |
| DPO-SBackbone=Qwen2.5-7B-Instruct2025.12 | 0.2609 | |
| DPO-MixBackbone=Qwen2.5-7B-Instruct2025.12 | 0.2555 | |
| DPO-HBackbone=Qwen2.5-7B-Instruct2025.12 | 0.2487 | |
| BFPOBackbone=Qwen2.5-7B-Instruct2025.12 | 0.2436 | |
| MoCANBackbone=Qwen2.5-7B-Instruct2025.12 | 0.2416 | |
| Qwen2.5-7B-Instruct2025.12 | 0.2407 | |
| NSPOBackbone=Qwen2.5-7B-Instruct2025.12 | 0.2405 | |
| PeCANBackbone=Qwen2.5-7B-Instruct2025.12 | 0.2357 | |
| W-DOORBackbone=Qwen2.5-7B-Instruct2025.12 | 0.2223 | |
| SafeRLHFBackbone=Qwen2.5-7B-Instruct2025.12 | 0.2184 | |
| NSPOBackbone=Llama3-8B-Instruct2025.12 | 0.1343 | |
| Llama3-8B-Instruct2025.12 | 0.1337 | |
| MoCANBackbone=Llama3-8B-Instruct2025.12 | 0.1334 | |
| BFPOBackbone=Llama3-8B-Instruct2025.12 | 0.1313 | |
| W-DOORBackbone=Llama3-8B-Instruct2025.12 | 0.1268 | |
| PeCANBackbone=Llama3-8B-Instruct2025.12 | 0.1144 | |
| DPO-MixBackbone=Llama3-8B-Instruct2025.12 | 0.1124 | |
| DPO-SBackbone=Llama3-8B-Instruct2025.12 | 0.1071 | |
| DPO-HBackbone=Llama3-8B-Instruct2025.12 | 0.1048 | |
| SafeRLHFBackbone=Llama3-8B-Instruct2025.12 | 0.0896 |