Operations Research Reasoning on OR-BIAS-BENCH ID
100RationalityDeepSeek-V3.2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DeepSeek-V3.22026.01 | 100 | 18.2 | |
| claude-haiku-4.52026.01 | 99.9 | 0 | |
| gpt-4.12026.01 | 99.9 | 11.5 | |
| Qwen3-8B-OM-CurriculumParameters=8B, Training=Curriculum2026.01 | 99.9 | 20 | |
| Qwen3-8B-OM-SFTParameters=8B, Training=SFT2026.01 | 99.8 | 4.9 | |
| claude-3.7-sonnet2026.01 | 99.8 | 11.3 | |
| gpt-5-mini2026.01 | 99.6 | 1.2 | |
| gpt-4.1-mini2026.01 | 99.6 | 4.1 | |
| qwen2.5-max2026.01 | 99.4 | 0.5 | |
| qwen2.5-14bParameters=14b2026.01 | 99.1 | 5.9 | |
| DeepSeek-R12026.01 | 98.6 | 44.1 | |
| o4-mini2026.01 | 98.5 | 6.7 | |
| o12026.01 | 98.2 | 23.2 | |
| gemini-2.5-pro2026.01 | 98.2 | 97.9 | |
| qwen2.5-7bParameters=7b2026.01 | 98.1 | 7.4 | |
| gemini-2.0-flash2026.01 | 97.6 | 5.9 | |
| gemini-2.5-flash2026.01 | 96.2 | 18.2 | |
| Qwen3-8B-OM-GRPOParameters=8B, Training=GRPO2026.01 | 96.1 | 48 | |
| qwen2.5-32bParameters=32b2026.01 | 95.9 | 15.4 | |
| o32026.01 | 93.1 | 0.4 | |
| kimi-k22026.01 | 92.8 | 8.9 | |
| claude-opus-42026.01 | 92.5 | 19 | |
| Llama-3.3-70BParameters=70B2026.01 | 92 | 19.2 | |
| claude-sonnet-42026.01 | 89 | 1.5 |