Operations Research on BWOR
81.3AccuracyOR-LLM-Agent
Evaluation Results
| Method | Links | |
|---|---|---|
| OR-LLM-AgentModel=Gemini-3-Flash2026.06 | 81.3 | |
| COOPAModel=GPT-5.22026.06 | 80 | |
| COOPAModel=GPT-52026.06 | 80 | |
| OR-LLM-AgentModel=o32026.06 | 80 | |
| OR-LLM-AgentModel=GPT-5.22026.06 | 78.8 | |
| OptiTreeModel=o32026.06 | 78.8 | |
| OR-LLM-AgentModel=o4-mini2026.06 | 78.8 | |
| OptiTreeModel=GPT-5.22026.06 | 77.5 | |
| COOPAModel=o4-mini2026.06 | 77.5 | |
| COOPAModel=Gemini-3-Flash2026.06 | 77.5 | |
| COOPAModel=Gemini-2.5-Flash2026.06 | 77.5 | |
| Chain-of-ExpertsModel=GPT-52026.06 | 76.3 | |
| COOPAModel=GPT-4.12026.06 | 76.3 | |
| Chain-of-ExpertsModel=GPT-5.22026.06 | 75 | |
| Chain-of-ExpertsModel=o32026.06 | 75 | |
| Chain-of-ExpertsModel=Gemini-3-Flash2026.06 | 75 | |
| OptiTreeModel=Gemini-3-Flash2026.06 | 75 | |
| COOPAModel=o32026.06 | 73.8 | |
| OR-LLM-AgentModel=GPT-4.12026.06 | 71.3 | |
| OptiTreeModel=o4-mini2026.06 | 71.3 | |
| Chain-of-ExpertsModel=GPT-4.12026.06 | 70 | |
| OptiTreeModel=Gemini-2.5-Flash2026.06 | 70 | |
| OR-LLM-AgentModel=Gemini-2.5-Flash2026.06 | 70 | |
| OptiTreeModel=GPT-4.12026.06 | 68.8 | |
| Chain-of-ExpertsModel=o4-mini2026.06 | 68.8 | |
| OR-LLM-AgentModel=GPT-52026.06 | 67.5 | |
| Chain-of-ExpertsModel=Qwen3-30B†2026.06 | 67.5 | |
| OR-LLM-AgentModel=Qwen3-30B†2026.06 | 62.5 | |
| OptiTreeModel=Qwen3-30B†2026.06 | 61.3 | |
| OptiMUSModel=GPT-4.12026.06 | 58.8 | |
| COOPAModel=Qwen3-30B†2026.06 | 56.3 | |
| OptiTreeModel=GPT-52026.06 | 52.5 | |
| OptiMUSModel=GPT-52026.06 | 47.5 | |
| Chain-of-ExpertsModel=Gemini-2.5-Flash2026.06 | 47.5 | |
| OptiMUSModel=o4-mini2026.06 | 43.8 | |
| OptiMUSModel=o32026.06 | 42.5 | |
| OptiMUSModel=Gemini-2.5-Flash2026.06 | 36.3 | |
| OptiMUSModel=Qwen3-30B†2026.06 | 35 | |
| OptiMUSModel=Gemini-3-Flash2026.06 | 28.8 | |
| OptiMUSModel=GPT-5.22026.06 | 25 |