Mathematical Problem Solving on AMC (Pass@1, Avg)
74.2Pass@1Qwen-2-7B w/ T3RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen-2-7B w/ T3RLModel Category=Vanilla Model, Backbone=Qwen-2-7B, Training Method=T3RL2026.03 | 74.2 | 68.1 | |
| Qwen-2-7B w/ TTRLModel Category=Vanilla Model, Backbone=Qwen-2-7B, Training Method=TTRL2026.03 | 71.7 | 65.5 | |
| Qwen-2.5-Math-1.5B w/ T3RLModel Category=Math Model, Backbone=Qwen-2.5-Math-1.5B, Training Method=T3RL2026.03 | 50.9 | 48.8 | |
| Qwen-2.5-Math-1.5B w/ TTRLModel Category=Math Model, Backbone=Qwen-2.5-Math-1.5B, Training Method=TTRL2026.03 | 48.9 | 45.9 | |
| Llama-3-8B-Instruct w/ T3RLModel Category=Instruct Model, Backbone=Llama-3-8B-Instruct, Training Method=T3RL2026.03 | 34.2 | 38.2 | |
| Llama-3-8B-Instruct w/ TTRLModel Category=Instruct Model, Backbone=Llama-3-8B-Instruct, Training Method=TTRL2026.03 | 31.3 | 35.4 | |
| Qwen-2.5-1.5B w/ T3RLModel Category=Vanilla Model, Backbone=Qwen-2.5-1.5B, Training Method=T3RL2026.03 | 30.7 | 33.3 | |
| Qwen-2.5-Math-1.5B (Baseline)Model Category=Math Model, Backbone=Qwen-2.5-Math-1.5B, Training Method=Baseline2026.03 | 28.6 | 23 | |
| Qwen-2.5-1.5B w/ TTRLModel Category=Vanilla Model, Backbone=Qwen-2.5-1.5B, Training Method=TTRL2026.03 | 28.6 | 31.8 | |
| Llama-3.2-1B-Instruct w/ T3RLModel Category=Instruct Model, Backbone=Llama-3.2-1B-Instruct, Training Method=T3RL2026.03 | 19.9 | 23.5 | |
| Llama-3-8B-Instruct (Baseline)Model Category=Instruct Model, Backbone=Llama-3-8B-Instruct, Training Method=Baseline2026.03 | 19.4 | 23.1 | |
| Llama-3.2-1B-Instruct w/ TTRLModel Category=Instruct Model, Backbone=Llama-3.2-1B-Instruct, Training Method=TTRL2026.03 | 16.9 | 21.5 | |
| Qwen-2-7B (Baseline)Model Category=Vanilla Model, Backbone=Qwen-2-7B, Training Method=Baseline2026.03 | 12.5 | 21 | |
| Llama-3.2-1B-Instruct (Baseline)Model Category=Instruct Model, Backbone=Llama-3.2-1B-Instruct, Training Method=Baseline2026.03 | 4.2 | 3.1 | |
| Qwen-2.5-1.5B (Baseline)Model Category=Vanilla Model, Backbone=Qwen-2.5-1.5B, Training Method=Baseline2026.03 | 0.6 | 2.8 |