Code Generation on CodeContests (Accuracy)
21.2AccuracyAFM-Coder
Evaluation Results
| Method | Links | |
|---|---|---|
| AFM-CoderTraining Paradigm=RL-based Auto MAS, Backbone=Qwen3 8B2026.05 | 21.2 | |
| SA + GRPOTraining Paradigm=Single Agent2026.05 | 18.6 | |
| AGPOclipping=adaptive, ATS=true2026.05 | 17.3 | |
| MetaAgent-X RLTraining Paradigm=RL-based Auto MAS, Backbone=Qwen3 8B2026.05 | 17 | |
| AFlowTraining Paradigm=Search-based Auto MAS, Backbone=Qwen3 8B2026.05 | 15.8 | |
| SATraining Paradigm=Single Agent, Backbone=Qwen3 8B2026.05 | 15.75 | |
| AGPOclipping=adaptive, ATS=false2026.05 | 15.2 | |
| MaASTraining Paradigm=RL-based Auto MAS, Backbone=Qwen3 8B2026.05 | 15.15 | |
| GRPOATS=true2026.05 | 14.9 | |
| SATraining Paradigm=Single Agent2026.05 | 14.8 | |
| MetaAgent-X RLTraining Paradigm=RL-based Auto MAS2026.05 | 14.2 | |
| GRPOclipping=fixed ε2026.05 | 14.1 | |
| AFlowTraining Paradigm=Search-based Auto MAS2026.05 | 13.33 | |
| ScoreFlowTraining Paradigm=RL-based Auto MAS, Backbone=Qwen3 8B2026.05 | 13.3 | |
| Adaptive-KL PPO2026.05 | 13.3 | |
| MetaAgent-X SFTTraining Paradigm=RL-based Auto MAS, Backbone=Qwen3 8B2026.05 | 13 | |
| DPO2026.05 | 12.4 | |
| PPO2026.05 | 12.3 | |
| ADASTraining Paradigm=Search-based Auto MAS, Backbone=Qwen3 8B2026.05 | 12.2 | |
| ADASTraining Paradigm=Search-based Auto MAS2026.05 | 12.2 | |
| SA + GRPOTraining Paradigm=Single Agent, Backbone=Qwen3 8B2026.05 | 12.12 | |
| ScoreFlowTraining Paradigm=RL-based Auto MAS2026.05 | 11.92 | |
| MaASTraining Paradigm=RL-based Auto MAS2026.05 | 9.1 | |
| Single AgentBackbone=Qwen3-14B2026.02 | 7.27 | |
| Dynamic-MAS + ADv2Backbone=Qwen3-14B2026.02 | 7.27 | |
| Dynamic-MASBackbone=Qwen3-14B2026.02 | 6.67 | |
| Dynamic-MAS + Self-RefineBackbone=Qwen3-14B2026.02 | 6.06 | |
| Dynamic-MAS + Multi-TAGBackbone=Qwen3-14B2026.02 | 6.06 | |
| MetaAgent-X SFTTraining Paradigm=RL-based Auto MAS2026.05 | 6 | |
| Dynamic-MAS + PRMBackbone=Qwen3-14B2026.02 | 5.45 |