RO reformulation on Large Out-of-Distribution
85.4AccuracyAutoREM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AutoREMBase LLM=DeepSeek-V4-Flash2026.05 | 85.4 | 10,929 | |
| Expert PromptBase LLM=DeepSeek-V4-Flash2026.05 | 79.2 | 13,243 | |
| Max ThinkingBase LLM=DeepSeek-V4-Flash2026.05 | 77.1 | 22,695 | |
| Base LLMBase LLM=DeepSeek-V4-Flash2026.05 | 76 | 11,757 | |
| ReasoningBankBase LLM=DeepSeek-V4-Flash2026.05 | 71.9 | 11,774 | |
| ACEBase LLM=DeepSeek-V4-Flash2026.05 | 63.5 | 6,706 |