Coding on LiveCodeBench
79Task AccuracyGPT-OSS-20B (high)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-OSS-20B (high)Inference Regime=Pass@52026.02 | 79 | 0.69 | 0.64 | 0.62 | |
| GPT-OSS-20B (low)Inference Regime=Pass@52026.02 | 77 | 0.71 | 0.66 | 0.64 | |
| GPT-OSS-20B (medium)Inference Regime=Pass@52026.02 | 77 | 0.67 | 0.64 | 0.6 | |
| Qwen3-4BStarting Checkpoint=Inst, Reasoning Strategy=Self-Contained Reasoning, Backbone Architecture Family=Qwen3-4B2026.02 | 35.1 | — | — | — | |
| DeepSeek-R1-Distill-Qwen-7BInference Regime=Pass@52026.02 | 30 | 0.81 | 0.83 | 0.59 | |
| ELPO-4BStarting Checkpoint=Inst, Backbone Architecture Family=Qwen3-4B2026.02 | 28.6 | — | — | — | |
| DemyAgent-4BStarting Checkpoint=Inst, Backbone Architecture Family=Qwen3-4B2026.02 | 26.8 | — | — | — | |
| Qwen3-4BStarting Checkpoint=Inst, Reasoning Strategy=TIR Reasoning, Backbone Architecture Family=Qwen3-4B2026.02 | 23 | — | — | — | |
| ELPO-7BStarting Checkpoint=Inst, Backbone Architecture Family=Qwen2.5-7B2026.02 | 19.7 | — | — | — | |
| CIRStarting Checkpoint=Math, Backbone Architecture Family=Qwen2.5-7B2026.02 | 19.3 | — | — | — | |
| DemyAgentStarting Checkpoint=Inst, Backbone Architecture Family=Qwen2.5-7B2026.02 | 18.9 | — | — | — | |
| DAPOStarting Checkpoint=Instruct, Backbone Architecture Family=Qwen2.5-7B2026.02 | 18.5 | — | — | — | |
| ARPOStarting Checkpoint=Inst, Backbone Architecture Family=Qwen2.5-7B2026.02 | 18.3 | — | — | — | |
| GIGPOStarting Checkpoint=Inst, Backbone Architecture Family=Qwen2.5-7B2026.02 | 18.1 | — | — | — | |
| ToRLStarting Checkpoint=Math-Inst, Backbone Architecture Family=Qwen2.5-7B2026.02 | 17.8 | — | — | — | |
| AEPOStarting Checkpoint=Inst, Backbone Architecture Family=Qwen2.5-7B2026.02 | 17.8 | — | — | — | |
| Reinforce++Starting Checkpoint=Instruct, Backbone Architecture Family=Qwen2.5-7B2026.02 | 17.1 | — | — | — | |
| GRPOStarting Checkpoint=Inst, Backbone Architecture Family=Qwen2.5-7B2026.02 | 16.8 | — | — | — | |
| DeepSeek-V3Starting Checkpoint=Base, Reasoning Strategy=Self-Contained Reasoning, Backbone Architecture Family=DeepSeek-V32026.02 | 16.1 | — | — | — | |
| Qwen2.5-7BStarting Checkpoint=Inst, Reasoning Strategy=Self-Contained Reasoning, Backbone Architecture Family=Qwen2.5-7B2026.02 | 15.2 | — | — | — | |
| Qwen2.5-Coder-7BInference Regime=Pass@52026.02 | 15 | 0.9 | 0.84 | 0.61 | |
| Qwen2.5-Coder-3BInference Regime=Pass@52026.02 | 14 | 0.91 | 0.86 | 0.64 | |
| Qwen2.5-7BStarting Checkpoint=Inst, Reasoning Strategy=TIR Reasoning, Backbone Architecture Family=Qwen2.5-7B2026.02 | 12.2 | — | — | — |