Optimization Modeling on IndustryOR (SA, Micro Average)
45SA ScoreOpt-Verifier
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Opt-VerifierMethod Category=Prompt-based Method, Backbone=GPT-4o-mini2026.05 | 45 | 64.3 | |
| ORLMMethod Category=Fine-tuned Method, Backbone=LLaMA-3-8B2026.05 | 38 | 41.3 | |
| Evo-StepMethod Category=Fine-tuned Method, Backbone=LLaMA-3-8B2026.05 | 36.3 | — | |
| OpenAI-o1Method Category=Reasoning LLMs, Backbone=OpenAI-o12026.05 | 36 | 58.1 | |
| SIRLMethod Category=Fine-tuned Method, Backbone=Qwen2.5-7B2026.05 | 33 | — | |
| DeepSeek-R1Method Category=Reasoning LLMs, Backbone=DeepSeek-R12026.05 | 32 | 56.7 | |
| OptiMUSMethod Category=Prompt-based Method, Backbone=GPT-4o-mini2026.05 | 31 | 50.6 | |
| LLMOPTMethod Category=Fine-tuned Method, Backbone=Qwen1.5-14B2026.05 | 29 | 47.7 | |
| CoEMethod Category=Prompt-based Method, Backbone=GPT-4o-mini2026.05 | 29 | 46.6 | |
| CoTMethod Category=Prompt-based Method, Backbone=GPT-4o-mini2026.05 | 27 | 37.2 | |
| StandardMethod Category=Prompt-based Method, Backbone=GPT-4o-mini2026.05 | 24 | 32.7 |