RO reformulation on Random In-Distribution
97.4AccuracyAutoREM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AutoREMBase LLM=DeepSeek-V4-Flash2026.05 | 97.4 | 6,386 | |
| Expert PromptBase LLM=DeepSeek-V4-Flash2026.05 | 92.7 | 8,750 | |
| Max ThinkingBase LLM=DeepSeek-V4-Flash2026.05 | 90.6 | 13,857 | |
| Base LLMBase LLM=DeepSeek-V4-Flash2026.05 | 87.5 | 7,777 | |
| ACEBase LLM=DeepSeek-V4-Flash2026.05 | 87 | 4,419 | |
| ReasoningBankBase LLM=DeepSeek-V4-Flash2026.05 | 85.4 | 6,575 |