Mathematical Reasoning on Olympiad (Avg@16 Accuracy)
70.7Avg@16 AccuracyResRL
Evaluation Results
| Method | Links | |
|---|---|---|
| ResRLBase Model=Qwen3-32B, Mode=Think mode, Max response length=81922026.05 | 70.7 | |
| FlowRLBackbone=Qwen3-8B, Max response length=40962026.05 | 68.5 | |
| ResRLBackbone=Qwen3-8B, Max response length=40962026.05 | 68.1 | |
| IRDSModel=QWEN3-4B, Data Budget=30%2026.05 | 67.2 | |
| NSR (Weighted-Reinforce)Base Model=Qwen3-32B, Mode=Think mode, Max response length=81922026.05 | 64.4 | |
| DEPOModel=QWEN3-4B, Data Budget=30%2026.05 | 63.4 | |
| LIMRModel=QWEN3-4B, Data Budget=30%2026.05 | 63 | |
| PPL-MIDDLEModel=QWEN3-4B, Data Budget=30%2026.05 | 62.9 | |
| GRPOBackbone=Qwen3-8B, Max response length=40962026.05 | 62 | |
| PPL-TOPModel=QWEN3-4B, Data Budget=30%2026.05 | 61.4 | |
| NSR (Weighted-Reinforce)Backbone=Qwen3-8B, Max response length=40962026.05 | 60.6 | |
| IFDModel=QWEN3-4B, Data Budget=30%2026.05 | 59 | |
| IRDSModel=QWEN3-4B, Data Budget=10%2026.05 | 58.4 | |
| FlowRLBackbone=Qwen3-4B, Max response length=40962026.05 | 58.1 | |
| ResRLBackbone=Qwen3-1.7B, Max response length=40962026.05 | 56.6 | |
| GRPOBackbone=Qwen3-4B, Max response length=40962026.05 | 55.1 | |
| RANDOMModel=QWEN3-4B, Data Budget=30%2026.05 | 54.8 | |
| NSR (Weighted-Reinforce)Backbone=Qwen3-1.7B, Max response length=40962026.05 | 53.5 | |
| IRDSModel=QWEN3-1.7B, Data Budget=30%2026.05 | 53.4 | |
| ResRLBackbone=Qwen3-4B, Max response length=40962026.05 | 52.3 | |
| TOKEN-LENGTHModel=QWEN3-4B, Data Budget=30%2026.05 | 52.2 | |
| DAPOBackbone=Qwen3-4B, Max response length=40962026.05 | 51.2 | |
| NSR (Weighted-Reinforce)Backbone=Qwen3-4B, Max response length=40962026.05 | 50.1 | |
| LIMRModel=QWEN3-1.7B, Data Budget=30%2026.05 | 49.7 | |
| IRDSModel=QWEN3-1.7B, Data Budget=10%2026.05 | 49.1 | |
| DEPOModel=QWEN3-1.7B, Data Budget=30%2026.05 | 49.1 | |
| FlowRLBackbone=Qwen3-1.7B, Max response length=40962026.05 | 48.6 | |
| Qwen3-8B BackboneBackbone=Qwen3-8B, Max response length=40962026.05 | 48.6 | |
| Qwen3-4B BackboneBackbone=Qwen3-4B, Max response length=40962026.05 | 48.2 | |
| PPL-MIDDLEModel=QWEN3-1.7B, Data Budget=30%2026.05 | 46.1 | |
| RANDOMModel=QWEN3-1.7B, Data Budget=30%2026.05 | 46 | |
| PPL-TOPModel=QWEN3-1.7B, Data Budget=30%2026.05 | 45 | |
| DAPOBackbone=Qwen3-8B, Max response length=40962026.05 | 43.6 | |
| IFDModel=QWEN3-1.7B, Data Budget=30%2026.05 | 42.8 | |
| TOKEN-LENGTHModel=QWEN3-1.7B, Data Budget=30%2026.05 | 40.9 | |
| Qwen3-1.7B BackboneBackbone=Qwen3-1.7B, Max response length=40962026.05 | 38.1 | |
| GRPOBackbone=Qwen3-1.7B, Max response length=40962026.05 | 36 | |
| DAPOBackbone=Qwen3-1.7B, Max response length=40962026.05 | 33.6 | |
| IRDSModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 16.8 | |
| RANDOMModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 16.1 | |
| LIMRModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 16.1 | |
| DEPOModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 15.6 | |
| TOKEN-LENGTHModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 15.4 | |
| IRDSModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=10%2026.05 | 15.3 | |
| PPL-MIDDLEModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 15.3 | |
| PPL-TOPModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 15.2 | |
| IFDModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 14.8 |