Physics Reasoning on IPhO Mechanics
40AccuracyQwen3-30B + RL (synthetic)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-30B + RL (synthetic)Model=Qwen3-30B, Post-training Stage=RL (synthetic)2026.04 | 40 | |
| Qwen3-30BModel=Qwen3-30B, Post-training Stage=Instruct2026.04 | 35.6 | |
| Qwen2.5-32B + RL (synthetic)Model=Qwen2.5-32B, Post-training Stage=RL (synthetic)2026.04 | 25.2 | |
| Qwen2.5-14B + RL (synthetic)Model=Qwen2.5-14B, Post-training Stage=RL (synthetic)2026.04 | 20.45 | |
| Qwen2.5-32BModel=Qwen2.5-32B, Post-training Stage=Instruct2026.04 | 19.8 | |
| Qwen2.5-14BModel=Qwen2.5-14B, Post-training Stage=Instruct2026.04 | 16.07 | |
| Qwen2.5-7B + RL (synthetic)Model=Qwen2.5-7B, Post-training Stage=RL (synthetic)2026.04 | 15.1 | |
| Qwen2.5-3B + RL (synthetic)Model=Qwen2.5-3B, Post-training Stage=RL (synthetic)2026.04 | 13.15 | |
| Qwen2.5-7BModel=Qwen2.5-7B, Post-training Stage=Instruct2026.04 | 10.7 | |
| Qwen2.5-3BModel=Qwen2.5-3B, Post-training Stage=Instruct2026.04 | 5.68 |