Physical Reasoning on PHYRE DeepPHY (test)
14.92Att. 1 ScoreQwen-7B^P&I GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen-7B^P&I GRPOPolicy Model=Qwen-7B^P&I GRPO, World Model=Qwen-7B^P&I2026.03 | 14.92 | 45.56 | |
| Qwen-7B^P&I GRPOPolicy Model=Qwen-7B^P&I GRPO, World Model=-2026.03 | 14.63 | 43.17 | |
| Qwen-3B^P&I GRPOPolicy Model=Qwen-3B^P&I GRPO, World Model=Qwen-3B^P&I2026.03 | 14.11 | 39.49 | |
| Qwen-3B^P&I GRPOPolicy Model=Qwen-3B^P&I GRPO, World Model=-2026.03 | 14 | 34.5 | |
| Qwen-7B^P GRPOPolicy Model=Qwen-7B^P GRPO, World Model=Qwen-7B^P2026.03 | 13.18 | 43.66 | |
| Qwen-7B^P GRPOPolicy Model=Qwen-7B^P GRPO, World Model=-2026.03 | 13 | 40 | |
| Qwen-3B^P&I SFTPolicy Model=Qwen-3B^P&I SFT, World Model=Qwen-3B^P&I2026.03 | 10.7 | 33.56 | |
| Qwen-3B^P&I SFTPolicy Model=Qwen-3B^P&I SFT, World Model=-2026.03 | 10.42 | 29 | |
| Qwen-3B^P GRPOPolicy Model=Qwen-3B^P GRPO, World Model=Qwen-3B^P2026.03 | 9.85 | 32 | |
| Qwen-3B^P GRPOPolicy Model=Qwen-3B^P GRPO, World Model=-2026.03 | 9.5 | 29.03 | |
| Qwen-7B^P&I SFTPolicy Model=Qwen-7B^P&I SFT, World Model=Qwen-7B^P&I2026.03 | 7.95 | 44.85 | |
| Qwen-7B^P&I SFTPolicy Model=Qwen-7B^P&I SFT, World Model=-2026.03 | 7.5 | 42.67 | |
| Qwen-7B^P SFTPolicy Model=Qwen-7B^P SFT, World Model=-2026.03 | 3.67 | 36.13 | |
| Qwen-7B^P SFTPolicy Model=Qwen-7B^P SFT, World Model=Qwen-7B^P2026.03 | 3.4 | 38.67 | |
| GPT-o3Policy Model=GPT-o3, World Model=-2026.03 | 3.03 | 30.77 | |
| Qwen-72BPolicy Model=Qwen-72B, World Model=-2026.03 | 2.43 | 14.92 | |
| Gemini-2.5-ProPolicy Model=Gemini-2.5-Pro, World Model=-2026.03 | 2.17 | 22.07 | |
| Gemini-2.5-ProPolicy Model=Gemini-2.5-Pro, World Model=Gemini-2.5-Pro2026.03 | 2.17 | 12.33 | |
| Qwen-72BPolicy Model=Qwen-72B, World Model=Qwen-72B2026.03 | 1.78 | 10.39 | |
| Claude 4.0 OpusPolicy Model=Claude 4.0 Opus, World Model=-2026.03 | 1.73 | 10.63 | |
| Qwen-3B^P SFTPolicy Model=Qwen-3B^P SFT, World Model=Qwen-3B^P2026.03 | 1.52 | 28.69 | |
| MOCKPolicy Model=MOCK, World Model=-2026.03 | 1.5 | 10.8 | |
| Qwen-3B^P SFTPolicy Model=Qwen-3B^P SFT, World Model=-2026.03 | 1.33 | 25.58 | |
| Claude 4.0 OpusPolicy Model=Claude 4.0 Opus, World Model=Claude 4.0 Opus2026.03 | 1.11 | 7.44 | |
| Qwen-7B^I SFTPolicy Model=Qwen-7B^I SFT, World Model=Qwen-7B^I2026.03 | 0.82 | 13.45 | |
| Qwen-3B^I SFTPolicy Model=Qwen-3B^I SFT, World Model=Qwen-3B^I2026.03 | 0.74 | 11.88 | |
| Qwen-7BPolicy Model=Qwen-7B, World Model=-2026.03 | 0.67 | 10.1 | |
| Qwen-7B^I SFTPolicy Model=Qwen-7B^I SFT, World Model=-2026.03 | 0.67 | 9.33 | |
| Qwen-7B^I GRPOPolicy Model=Qwen-7B^I GRPO, World Model=-2026.03 | 0.67 | 8.33 | |
| Qwen-7B^I GRPOPolicy Model=Qwen-7B^I GRPO, World Model=Qwen-7B^I2026.03 | 0.67 | 13.04 | |
| Qwen-3B^I GRPOPolicy Model=Qwen-3B^I GRPO, World Model=Qwen-3B^I2026.03 | 0.66 | 13.48 | |
| Qwen-3B^I SFTPolicy Model=Qwen-3B^I SFT, World Model=-2026.03 | 0.33 | 9.83 | |
| Qwen-3BPolicy Model=Qwen-3B, World Model=-2026.03 | 0.17 | 5.85 | |
| GPT-o3Policy Model=GPT-o3, World Model=GPT-o32026.03 | 0.17 | 25.6 | |
| Qwen-3B^I GRPOPolicy Model=Qwen-3B^I GRPO, World Model=-2026.03 | 0.17 | 9.67 | |
| Qwen-32BPolicy Model=Qwen-32B, World Model=-2026.03 | 0.03 | 8.7 |