LLM-based Optimization on ORCOpt-Bench
47.2Accuracy RateR2C
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| R2CBackbone=DeepSeek-v3.2, Evaluation Protocol=Zero-shot pass@12026.02 | 47.2 | 83.2 | |
| Grok4Backbone=Grok4, Evaluation Protocol=Zero-shot pass@12026.02 | 45.4 | 87.4 | |
| GPT5Backbone=GPT5, Evaluation Protocol=Zero-shot pass@12026.02 | 39.8 | 80.8 | |
| ReflexionBackbone=DeepSeek-v3.2, Evaluation Protocol=Zero-shot pass@12026.02 | 37.8 | 85.2 | |
| Self-RAG-rawBackbone=DeepSeek-v3.2, Evaluation Protocol=Zero-shot pass@12026.02 | 30.4 | 78.2 | |
| Chain-of-ExpertsBackbone=DeepSeek-v3.2, Evaluation Protocol=Zero-shot pass@12026.02 | 30.2 | 80.6 | |
| Vanilla RAG-rawBackbone=DeepSeek-v3.2, Evaluation Protocol=Zero-shot pass@12026.02 | 28 | 78.4 | |
| Standard promptBackbone=DeepSeek-v3.2, Evaluation Protocol=Zero-shot pass@12026.02 | 22.4 | 74.8 | |
| R2CBackbone=Qwen3-32B, Evaluation Protocol=Zero-shot pass@12026.02 | 21.2 | 64 | |
| Standard promptBackbone=Qwen3 32B, Evaluation Protocol=Zero-shot pass@12026.02 | 8 | 36.6 |