General Problem Solving on Mixed (AIME, GPQA, HLE, HotpotQA, ALFWorld)
57.74Average ScoreUMEM-Qwen3-4B
Evaluation Results
| Method | Links | |
|---|---|---|
| UMEM-Qwen3-4BFrozen Executor=GPT-5.1, Parameters=4B2026.02 | 57.74 | |
| UMEM-Qwen3-4BFrozen Executor=Gemini-2.5-Flash, Parameters=4B2026.02 | 55.47 | |
| MempFrozen Executor=GPT-5.1, Parameters=API2026.02 | 54.71 | |
| UMEM-Llama-3.2-1BFrozen Executor=Gemini-2.5-Flash, Parameters=1B2026.02 | 53.6 | |
| Qwen3-4B-InstructFrozen Executor=GPT-5.1, Parameters=4B2026.02 | 53.18 | |
| Self-RAGFrozen Executor=Gemini-2.5-Flash, Parameters=API2026.02 | 52.46 | |
| MempFrozen Executor=Gemini-2.5-Flash, Parameters=API2026.02 | 52.29 | |
| Self-RAGFrozen Executor=GPT-5.1, Parameters=API2026.02 | 51.95 | |
| UMEM-Llama-3.2-1BFrozen Executor=GPT-5.1, Parameters=1B2026.02 | 51.79 | |
| ReMemFrozen Executor=Gemini-2.5-Flash, Parameters=API2026.02 | 50.99 | |
| Qwen3-4B-InstructFrozen Executor=Gemini-2.5-Flash, Parameters=4B2026.02 | 50.9 | |
| UMEM-Qwen3-4BFrozen Executor=Qwen3-8B-Thinking, Parameters=4B2026.02 | 50.88 | |
| Llama-3.2-1B-InstructFrozen Executor=Gemini-2.5-Flash, Parameters=1B2026.02 | 50.34 | |
| UMEM-Llama-3.2-1BFrozen Executor=Qwen3-8B-Thinking, Parameters=1B2026.02 | 49.82 | |
| Llama-3.2-1B-InstructFrozen Executor=GPT-5.1, Parameters=1B2026.02 | 49.75 | |
| ReMemFrozen Executor=GPT-5.1, Parameters=API2026.02 | 49.49 | |
| No MemoryFrozen Executor=Gemini-2.5-Flash, Parameters=-2026.02 | 49.14 | |
| Llama-3.2-1B-InstructFrozen Executor=Qwen3-8B-Thinking, Parameters=1B2026.02 | 48.38 | |
| MempFrozen Executor=Qwen3-8B-Thinking, Parameters=8B2026.02 | 47.32 | |
| No MemoryFrozen Executor=Qwen3-8B-Thinking, Parameters=-2026.02 | 47.28 | |
| Qwen3-4B-InstructFrozen Executor=Qwen3-8B-Thinking, Parameters=4B2026.02 | 46.95 | |
| No MemoryFrozen Executor=GPT-5.1, Parameters=-2026.02 | 45.36 | |
| ReMemFrozen Executor=Qwen3-8B-Thinking, Parameters=8B2026.02 | 41.51 | |
| Self-RAGFrozen Executor=Qwen3-8B-Thinking, Parameters=8B2026.02 | 32.06 |