Optimization Modeling on ComplexOR (Accuracy and Run Time)
58.9AccuracySAC-Opt
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SAC-Opt2025.09 | 58.9 | 42.02 | |
| SAC-OptBackbone=GPT-4o, Number of runs=52025.09 | 58.9 | — | |
| SAC-Opt2025.09 | 58.9 | — | |
| CoEreferenced=true2025.09 | 57.1 | — | |
| Best-baseline2025.09 | 52.2 | 68.68 | |
| OptiMUS-0.3Backbone=GPT-4o, Number of runs=52025.09 | 52.2 | — | |
| OptiMUSversion=0.32025.09 | 52.2 | — | |
| OptiMUS-0.2Backbone=GPT-4o, Number of runs=52025.09 | 48.9 | — | |
| OptiMUSversion=0.22025.09 | 48.9 | — | |
| CAFAreferenced=true2025.09 | 46.4 | — | |
| Standardreferenced=true2025.09 | 42.9 | — | |
| ReflexionBackbone=GPT-4o, Number of runs=52025.09 | 42.2 | — | |
| Reflexion2025.09 | 42.2 | — | |
| CoTreferenced=true2025.09 | 39.2 | — | |
| CAFA2025.09 | — | 9.22 | |
| CoE2025.09 | — | 68.68 | |
| CoT2025.09 | — | 9.25 | |
| OptiMUSthreshold=0.22025.09 | — | 84.63 | |
| OptiMUSthreshold=0.32025.09 | — | 52.96 | |
| Reflexion2025.09 | — | 11.64 | |
| SAC-Opt-LLMverification=LLM-based2025.09 | — | 42.02 | |
| SAC-Opt-Simverification=similarity-based2025.09 | — | 66.58 | |
| Standard2025.09 | — | 6.77 |