Discriminative Reasoning on RPEval Multi-MICRO Explicit Memory
0.71IA ScoreGPT-5 + RP-Reasoner
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5 + RP-ReasonerBase Model=GPT-5, Prompt Strategy=RP-Reasoner2026.01 | 0.71 | 0.69 | 0.7 | |
| GPT-4.1 + RP-ReasonerBase Model=GPT-4.1, Prompt Strategy=RP-Reasoner2026.01 | 0.69 | 0.65 | 0.63 | |
| DeepSeek-V3 + CoTBase Model=DeepSeek-V3, Prompt Strategy=Chain-of-Thought2026.01 | 0.67 | 0.67 | 0.67 | |
| DeepSeek-V3 + RP-ReasonerBase Model=DeepSeek-V3, Prompt Strategy=RP-Reasoner2026.01 | 0.67 | 0.7 | 0.69 | |
| DeepSeek-V3 + ReminderBase Model=DeepSeek-V3, Prompt Strategy=Reminder2026.01 | 0.57 | 0.56 | 0.56 | |
| GPT-4.1 + CoTBase Model=GPT-4.1, Prompt Strategy=Chain-of-Thought2026.01 | 0.56 | 0.61 | 0.59 | |
| Qwen2.5-7B + RP-ReasonerBase Model=Qwen2.5-7B, Prompt Strategy=RP-Reasoner2026.01 | 0.55 | 0.47 | 0.49 | |
| DeepSeek-V3Base Model=DeepSeek-V3, Prompt Strategy=Vanilla2026.01 | 0.55 | 0.56 | 0.56 | |
| GPT-4.1 + ReminderBase Model=GPT-4.1, Prompt Strategy=Reminder2026.01 | 0.52 | 0.48 | 0.49 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B, Prompt Strategy=Vanilla2026.01 | 0.48 | 0.3 | 0.36 | |
| GPT-4.1Base Model=GPT-4.1, Prompt Strategy=Vanilla2026.01 | 0.48 | 0.51 | 0.5 | |
| Qwen2.5-7B + ReminderBase Model=Qwen2.5-7B, Prompt Strategy=Reminder2026.01 | 0.45 | 0.36 | 0.39 | |
| GPT-5 + CoTBase Model=GPT-5, Prompt Strategy=Chain-of-Thought2026.01 | 0.38 | 0.52 | 0.47 | |
| GPT-5Base Model=GPT-5, Prompt Strategy=Vanilla2026.01 | 0.31 | 0.43 | 0.4 | |
| GPT-5 + ReminderBase Model=GPT-5, Prompt Strategy=Reminder2026.01 | 0.26 | 0.46 | 0.39 | |
| Qwen2.5-7B + CoTBase Model=Qwen2.5-7B, Prompt Strategy=Chain-of-Thought2026.01 | 0.18 | 0.13 | 0.15 |