Optimization modeling on OptiBench
80.16AccuracyDCM-Agent
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DCM-AgentBackbone=GPT5.12026.04 | 80.16 | — | — | |
| OptiTreeBackbone=GPT5.12026.04 | 76.86 | — | — | |
| DeepSeek-R1-0528Paradigm=Prompting-based, Solver=Gurobi2026.04 | 76.21 | — | — | |
| DCM-AgentBackbone=Qwen3-235B2026.04 | 75.21 | — | — | |
| AF-MCTSBackbone=GPT5.12026.04 | 74.71 | — | — | |
| DCM-AgentBackbone=Deepseek-V3.22026.04 | 74.05 | — | — | |
| OpenAI o1Paradigm=Prompting-based, Solver=Gurobi2026.04 | 71.4 | — | — | |
| OptiMUSBackbone=GPT5.12026.04 | 71.07 | — | — | |
| OptiTreeBackbone=Qwen3-235B2026.04 | 70.74 | — | — | |
| OptiTreeBackbone=Deepseek-V3.22026.04 | 70.08 | — | — | |
| AF-MCTSBackbone=Qwen3-235B2026.04 | 68.26 | — | — | |
| BaselineBackbone=GPT5.12026.04 | 68.26 | — | — | |
| AF-MCTSBackbone=Deepseek-V3.22026.04 | 67.27 | — | — | |
| DCM-AgentBackbone=Qwen3-30B2026.04 | 64.3 | — | — | |
| OptiMUSBackbone=Qwen3-235B2026.04 | 64.3 | — | — | |
| EVOM (GRPO)Paradigm=Training-based, Base Model=Qwen2.5-7B, Solver=Gurobi2026.04 | 62.95 | — | — | |
| OptiMUSBackbone=Deepseek-V3.22026.04 | 62.15 | — | — | |
| ORLM (SFT)Paradigm=Training-based, Base Model=Qwen2.5-7B, Solver=Gurobi2026.04 | 60.96 | — | — | |
| BaselineBackbone=Qwen3-235B2026.04 | 60.83 | — | — | |
| OptiTreeBackbone=Qwen3-30B2026.04 | 59.5 | — | — | |
| BaselineBackbone=Deepseek-V3.22026.04 | 58.68 | — | — | |
| AF-MCTSBackbone=Qwen3-30B2026.04 | 57.68 | — | — | |
| OptiMUSBackbone=Qwen3-30B2026.04 | 56.2 | — | — | |
| DCM-AgentBackbone=Qwen3-8B2026.04 | 55.37 | — | — | |
| OptiMUSParadigm=Prompting-based, Solver=Gurobi2026.04 | 45.8 | — | — | |
| OptiTreeBackbone=Qwen3-8B2026.04 | 45.12 | — | — | |
| OptiMUSBackbone=Qwen3-8B2026.04 | 44.13 | — | — | |
| BaselineBackbone=Qwen3-30B2026.04 | 43.64 | — | — | |
| GPT-4o (CoE)Paradigm=Prompting-based, Solver=Gurobi2026.04 | 43.2 | — | — | |
| GPT-4o (Standard)Paradigm=Prompting-based, Solver=Gurobi2026.04 | 42.3 | — | — | |
| GPT-4o (CoT)Paradigm=Prompting-based, Solver=Gurobi2026.04 | 42 | — | — | |
| Base ModelParadigm=Training-based, Base Model=Qwen2.5-7B, Solver=Gurobi2026.04 | 41.19 | — | — | |
| AF-MCTSBackbone=Qwen3-8B2026.04 | 36.53 | — | — | |
| BaselineBackbone=Qwen3-8B2026.04 | 30.58 | — | — | |
| AlphaOPTCategory=Experience-Enhanced Methods2026.05 | — | — | 70.25 | |
| Chain-of-ExpertsType=Prompt-based2026.04 | — | 69.26 | — | |
| Chain-of-ExpertsCategory=Agent-Based Methods2026.05 | — | — | 62.31 | |
| Chain-of-ExpertsCategory=Prompt-based Methods, Avg.=45.78, Rank=112026.06 | — | — | 45.29 | |
| Deepseek-R1Type=Reasoning2026.04 | — | 74.21 | — | |
| DeepSeek-R1 (671B)Category=General Models (Thinking), Avg.=60.85, Rank=22026.06 | — | — | 66.94 | |
| Deepseek-V3Type=Non-reasoning2026.04 | — | 64.79 | — | |
| DeepSeek-V3 (671B)Category=General Models, Avg.=60.14, Rank=32026.06 | — | — | 64.13 | |
| DeepSeek-V3.2Category=General Models2026.05 | — | — | 62.64 | |
| Gemini-2.5-ProCategory=General Models (Thinking), Avg.=57.39, Rank=72026.06 | — | — | 61.32 | |
| Gemini-3.1-ProCategory=General Models2026.05 | — | — | 66.56 | |
| GPT-4oType=Non-reasoning2026.04 | — | 58.51 | — | |
| GPT-5Category=General Models (Thinking), Avg.=57.54, Rank=62026.06 | — | — | 64.63 | |
| GPT-5.4Category=General Models2026.05 | — | — | 69.09 | |
| GPT-o4-miniType=Reasoning2026.04 | — | 64.13 | — | |
| LEAN-LLM-OPTCategory=Experience-Enhanced Methods2026.05 | — | — | 62.15 | |
| LLMOPTType=Fine-tuning2026.04 | — | 66.44 | — | |
| LLMOPT-14BCategory=Learning-based Models, Avg.=60.10, Rank=42026.06 | — | — | 53.83 | |
| MiniOpt-3BCategory=Ours, Avg.=59.65, Rank=5, Rank*=22026.06 | — | — | 55.21 | |
| MiniOpt-7BCategory=Ours, Avg.=64.76, Rank=1, Rank*=12026.06 | — | — | 60 | |
| NEDTreeType=Context-based2026.04 | — | 86.86 | — | |
| OPTIBENCHType=Fine-tuning2026.04 | — | 66.1 | — | |
| OptimusType=Prompt-based2026.04 | — | 64.96 | — | |
| OptiMUSCategory=Agent-Based Methods2026.05 | — | — | 60.99 | |
| OptiMUSCategory=Prompt-based Methods, Avg.=20.65, Rank=172026.06 | — | — | 26.61 | |
| OptMATH-7BCategory=Learning-based Models, Avg.=54.62, Rank=8, Rank*=32026.06 | — | — | 52.23 | |
| OptSkills-DCategory=Skill-Based Methods, Base Model=DeepSeek-V3.22026.05 | — | — | 77.02 | |
| OptSkills-QCategory=Skill-Based Methods, Base Model=Qwen3-235B-A22b-instruct-25072026.05 | — | — | 71.74 | |
| ORllmAgentType=Prompt-based2026.04 | — | 69.75 | — | |
| ORLM(best)Type=Fine-tuning2026.04 | — | 54.55 | — | |
| ORMindCategory=Agent-Based Methods2026.05 | — | — | 61.82 | |
| ORThoughtCategory=Agent-Based Methods2026.05 | — | — | 57.69 | |
| Qwen2.5-14B-InstructCategory=General Models, Avg.=47.46, Rank=102026.06 | — | — | 41.65 | |
| Qwen2.5-3B-InstructCategory=General Models, Avg.=11.23, Rank=18, Rank*=92026.06 | — | — | 11.74 | |
| Qwen2.5-7B-InstructCategory=General Models, Avg.=33.20, Rank=14, Rank*=62026.06 | — | — | 35.54 | |
| Qwen3-14BCategory=General Models (Thinking), Avg.=23.78, Rank=152026.06 | — | — | 22.31 | |
| Qwen3-235BCategory=General Models2026.05 | — | — | 63.8 | |
| Qwen3-4BCategory=General Models (Thinking), Avg.=11.16, Rank=19, Rank*=82026.06 | — | — | 11.9 | |
| Qwen3-8BCategory=General Models (Thinking), Avg.=21.79, Rank=16, Rank*=72026.06 | — | — | 28.26 | |
| ReflexionCategory=Prompt-based Methods, Avg.=45.54, Rank=122026.06 | — | — | 41.16 | |
| Step-OPT-Qwen2.5-3BCategory=Learning-based Models, Avg.=39.76, Rank=13, Rank*=52026.06 | — | — | 40 | |
| Step-OPT-Qwen2.5-7BCategory=Learning-based Models, Avg.=52.22, Rank=9, Rank*=42026.06 | — | — | 48.76 | |
| Trace2SkillCategory=Skill-Based Methods2026.05 | — | — | 75.21 |