Optimization Modeling on IndustryOR
61Accuracy RateGrok-4
Evaluation Results
| Method | Links | |
|---|---|---|
| Grok-42026.02 | 61 | |
| Grok42026.02 | 61 | |
| GPT-52026.02 | 59 | |
| R2C with reflectionReflection mechanism=Enabled, Maximum reflection iterations=32026.02 | 59 | |
| GPT52026.02 | 59 | |
| R2CReflection mechanism=Disabled2026.02 | 57 | |
| R2CBackbone=deepseek-v3.22026.02 | 57 | |
| DeepSeek-R1-0528Paradigm=Prompting-based, Solver=Gurobi2026.04 | 54 | |
| Standard PromptBackbone=deepseek-v3.22026.02 | 53 | |
| OpenAI o1Paradigm=Prompting-based, Solver=Gurobi2026.04 | 40 | |
| ORLMBackbone=LLaMa3-8B2026.02 | 38 | |
| OR-LLM-AgentBackbone=DeepSeek-R12026.02 | 36 | |
| GPT-4o (CoE)Paradigm=Prompting-based, Solver=Gurobi2026.04 | 34 | |
| OptiMUSParadigm=Prompting-based, Solver=Gurobi2026.04 | 34 | |
| EVOM (GRPO)Paradigm=Training-based, Base Model=Qwen2.5-7B, Solver=Gurobi2026.04 | 31 | |
| GPT-4o (CoT)Paradigm=Prompting-based, Solver=Gurobi2026.04 | 29 | |
| GPT-42026.02 | 28 | |
| GPT-4o (Standard)Paradigm=Prompting-based, Solver=Gurobi2026.04 | 27 | |
| ORLM (SFT)Paradigm=Training-based, Base Model=Qwen2.5-7B, Solver=Gurobi2026.04 | 27 | |
| Base ModelParadigm=Training-based, Base Model=Qwen2.5-7B, Solver=Gurobi2026.04 | 21 |