General Reasoning on GSM8k, MATH 500, GPQA, SuperGPQA
63.8Average AccuracyBF16
Evaluation Results
| Method | Links | |
|---|---|---|
| BF16Model=Qwen3-8B-Base, Rollout Length=8k, Training Dataset (RL)=GSM8k + MATH2026.01 | 63.8 | |
| Jet-RLModel=Qwen3-8B-Base, Rollout Length=8k, Training Dataset (RL)=GSM8k + MATH2026.01 | 62.7 | |
| BF16-Train-FP8-RolloutModel=Qwen3-8B-Base, Rollout Length=8k, Training Dataset (RL)=GSM8k + MATH2026.01 | 60.9 | |
| BF16Model=Qwen2.5-7B, Rollout Length=8k, Training Dataset (RL)=GSM8k + MATH2026.01 | 56.9 | |
| Jet-RLModel=Qwen2.5-7B, Rollout Length=8k, Training Dataset (RL)=GSM8k + MATH2026.01 | 55.9 | |
| InitialModel=Qwen3-8B-Base, Rollout Length=8k, Training Dataset (RL)=GSM8k + MATH2026.01 | 52.6 | |
| InitialModel=Qwen2.5-7B, Rollout Length=8k, Training Dataset (RL)=GSM8k + MATH2026.01 | 29.6 | |
| Jet-RLModel=Llama3.1-8B, Rollout Length=8k, Training Dataset (RL)=GSM8k + MATH2026.01 | 25.2 | |
| BF16Model=Llama3.1-8B, Rollout Length=8k, Training Dataset (RL)=GSM8k + MATH2026.01 | 23.2 | |
| BF16-Train-FP8-RolloutModel=Llama3.1-8B, Rollout Length=8k, Training Dataset (RL)=GSM8k + MATH2026.01 | 13 | |
| InitialModel=Llama3.1-8B, Rollout Length=8k, Training Dataset (RL)=GSM8k + MATH2026.01 | 8.5 |