Physical Reasoning on I-PHYRE DeepPHY (test)
37.6Attention Score 1Qwen-3B^I GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen-3B^I GRPOPolicy Model=Qwen-3B^I GRPO, World Model=Qwen-3B^I2026.03 | 37.6 | 51 | |
| Claude 4.0 OpusPolicy Model=Claude 4.0 Opus, World Model=-2026.03 | 36.67 | 56.67 | |
| Qwen-3B^I GRPOPolicy Model=Qwen-3B^I GRPO, World Model=-2026.03 | 36.67 | 48.89 | |
| Qwen-3B^P&I GRPOPolicy Model=Qwen-3B^P&I GRPO, World Model=-2026.03 | 36.67 | 60 | |
| Qwen-3B^P&I GRPOPolicy Model=Qwen-3B^P&I GRPO, World Model=Qwen-3B^P&I2026.03 | 35.66 | 61.99 | |
| Qwen-7BPolicy Model=Qwen-7B, World Model=-2026.03 | 32.42 | 32.42 | |
| Claude 4.0 OpusPolicy Model=Claude 4.0 Opus, World Model=Claude 4.0 Opus2026.03 | 30 | 50 | |
| GPT-o3Policy Model=GPT-o3, World Model=-2026.03 | 30 | 86.67 | |
| Qwen-7B^I GRPOPolicy Model=Qwen-7B^I GRPO, World Model=Qwen-7B^I2026.03 | 27.82 | 89.31 | |
| Qwen-7B^I GRPOPolicy Model=Qwen-7B^I GRPO, World Model=-2026.03 | 26.67 | 86.67 | |
| GPT-o3Policy Model=GPT-o3, World Model=GPT-o32026.03 | 25 | 76.67 | |
| MOCKPolicy Model=MOCK, World Model=-2026.03 | 23.33 | 53.33 | |
| Qwen-3B^I SFTPolicy Model=Qwen-3B^I SFT, World Model=-2026.03 | 23.33 | 45.56 | |
| Qwen-3B^I SFTPolicy Model=Qwen-3B^I SFT, World Model=Qwen-3B^I2026.03 | 23.21 | 47.34 | |
| Qwen-7B^P&I SFTPolicy Model=Qwen-7B^P&I SFT, World Model=Qwen-7B^P&I2026.03 | 21.41 | 65.38 | |
| Qwen-3B^P&I SFTPolicy Model=Qwen-3B^P&I SFT, World Model=Qwen-3B^P&I2026.03 | 21.29 | 52.91 | |
| Gemini-2.5-ProPolicy Model=Gemini-2.5-Pro, World Model=-2026.03 | 20 | 63.33 | |
| Qwen-3B^P SFTPolicy Model=Qwen-3B^P SFT, World Model=-2026.03 | 20 | 30 | |
| Qwen-3B^P&I SFTPolicy Model=Qwen-3B^P&I SFT, World Model=-2026.03 | 20 | 50 | |
| Qwen-7B^P&I SFTPolicy Model=Qwen-7B^P&I SFT, World Model=-2026.03 | 20 | 63.33 | |
| Qwen-3B^P SFTPolicy Model=Qwen-3B^P SFT, World Model=Qwen-3B^P2026.03 | 19.87 | 32.45 | |
| Gemini-2.5-ProPolicy Model=Gemini-2.5-Pro, World Model=Gemini-2.5-Pro2026.03 | 16.67 | 53.33 | |
| Qwen-7B^P GRPOPolicy Model=Qwen-7B^P GRPO, World Model=-2026.03 | 16.67 | 28.89 | |
| Qwen-7B^P GRPOPolicy Model=Qwen-7B^P GRPO, World Model=Qwen-7B^P2026.03 | 15.68 | 30 | |
| Qwen-7B^P SFTPolicy Model=Qwen-7B^P SFT, World Model=Qwen-7B^P2026.03 | 13.57 | 22.15 | |
| Qwen-3BPolicy Model=Qwen-3B, World Model=-2026.03 | 13.33 | 16.67 | |
| Qwen-72BPolicy Model=Qwen-72B, World Model=-2026.03 | 13.33 | 43.33 | |
| Qwen-3B^P GRPOPolicy Model=Qwen-3B^P GRPO, World Model=-2026.03 | 13.33 | 26.67 | |
| Qwen-7B^P SFTPolicy Model=Qwen-7B^P SFT, World Model=-2026.03 | 13.33 | 19.33 | |
| Qwen-7B^P&I GRPOPolicy Model=Qwen-7B^P&I GRPO, World Model=-2026.03 | 13.33 | 90 | |
| Qwen-7B^P&I GRPOPolicy Model=Qwen-7B^P&I GRPO, World Model=Qwen-7B^P&I2026.03 | 13.12 | 93.33 | |
| Qwen-3B^P GRPOPolicy Model=Qwen-3B^P GRPO, World Model=Qwen-3B^P2026.03 | 12.78 | 28 | |
| Qwen-7B^I SFTPolicy Model=Qwen-7B^I SFT, World Model=-2026.03 | 12.22 | 50 | |
| Qwen-7B^I SFTPolicy Model=Qwen-7B^I SFT, World Model=Qwen-7B^I2026.03 | 11.34 | 51.5 | |
| Qwen-72BPolicy Model=Qwen-72B, World Model=Qwen-72B2026.03 | 10 | 36.67 | |
| Qwen-32BPolicy Model=Qwen-32B, World Model=-2026.03 | 0.17 | 5.6 |