Optimization Modeling on ComplexOR (SA, Micro Average)
78.9SAOpt-Verifier
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Opt-VerifierMethod Category=Prompt-based Method, Backbone=GPT-4o-mini2026.05 | 78.9 | 64.3 | |
| OptiMUSMethod Category=Prompt-based Method, Backbone=GPT-4o-mini2026.05 | 73.6 | 50.6 | |
| LLMOPTMethod Category=Fine-tuned Method, Backbone=Qwen1.5-14B2026.05 | 72.7 | 47.7 | |
| DeepSeek-R1Method Category=Reasoning LLMs, Backbone=DeepSeek-R12026.05 | 68.4 | 56.7 | |
| OpenAI-o1Method Category=Reasoning LLMs, Backbone=OpenAI-o12026.05 | 68.4 | 58.1 | |
| CoEMethod Category=Prompt-based Method, Backbone=GPT-4o-mini2026.05 | 68.4 | 46.6 | |
| GPT-5Category=General Models (Thinking), Avg.=57.54, Rank=62026.06 | 61.11 | — | |
| Gemini-2.5-ProCategory=General Models (Thinking), Avg.=57.39, Rank=72026.06 | 50 | — | |
| DeepSeek-V3 (671B)Category=General Models, Avg.=60.14, Rank=32026.06 | 44.44 | — | |
| DeepSeek-R1 (671B)Category=General Models (Thinking), Avg.=60.85, Rank=22026.06 | 44.44 | — | |
| ORLMMethod Category=Fine-tuned Method, Backbone=LLaMA-3-8B2026.05 | 42.1 | 41.3 | |
| Qwen3-14BCategory=General Models (Thinking), Avg.=23.78, Rank=152026.06 | 38.89 | — | |
| ReflexionCategory=Prompt-based Methods, Avg.=45.54, Rank=122026.06 | 38.89 | — | |
| Step-OPT-Qwen2.5-7BCategory=Learning-based Models, Avg.=52.22, Rank=9, Rank*=42026.06 | 38.89 | — | |
| MiniOpt-7BCategory=Ours, Avg.=64.76, Rank=1, Rank*=12026.06 | 38.89 | — | |
| CoTMethod Category=Prompt-based Method, Backbone=GPT-4o-mini2026.05 | 36.8 | 37.2 | |
| LLMOPT-14BCategory=Learning-based Models, Avg.=60.10, Rank=42026.06 | 35.29 | — | |
| Chain-of-ExpertsCategory=Prompt-based Methods, Avg.=45.78, Rank=112026.06 | 33.33 | — | |
| OptMATH-7BCategory=Learning-based Models, Avg.=54.62, Rank=8, Rank*=32026.06 | 33.33 | — | |
| StandardMethod Category=Prompt-based Method, Backbone=GPT-4o-mini2026.05 | 31.5 | 32.7 | |
| Step-OPT-Qwen2.5-3BCategory=Learning-based Models, Avg.=39.76, Rank=13, Rank*=52026.06 | 27.78 | — | |
| MiniOpt-3BCategory=Ours, Avg.=59.65, Rank=5, Rank*=22026.06 | 27.78 | — | |
| Qwen2.5-14B-InstructCategory=General Models, Avg.=47.46, Rank=102026.06 | 22.22 | — | |
| Qwen2.5-7B-InstructCategory=General Models, Avg.=33.20, Rank=14, Rank*=62026.06 | 16.67 | — | |
| OptiMUSCategory=Prompt-based Methods, Avg.=20.65, Rank=172026.06 | 16.67 | — | |
| Qwen3-8BCategory=General Models (Thinking), Avg.=21.79, Rank=16, Rank*=72026.06 | 11.11 | — | |
| Qwen3-4BCategory=General Models (Thinking), Avg.=11.16, Rank=19, Rank*=82026.06 | 5.56 | — | |
| Qwen2.5-3B-InstructCategory=General Models, Avg.=11.23, Rank=18, Rank*=92026.06 | 0 | — |