Trustworthiness Evaluation on Trust-Memevo Math Domain
36.7No-Memory ScoreReasoningbank+Guard
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Reasoningbank+GuardLLM Backbone=Qwen3-32B2026.02 | 36.7 | 0.382 | 0.385 | 0.369 | |
| Reasoningbank+promptLLM Backbone=Qwen3-32B2026.02 | 36.3 | 0.343 | 0.367 | 0.363 | |
| MementoLLM Backbone=GPT-5.22026.02 | 36.2 | 0.377 | 0.374 | 0.37 | |
| Reasoningbank+promptLLM Backbone=GPT-5.22026.02 | 36.1 | 0.368 | 0.366 | 0.365 | |
| Reasoningbank+GuardLLM Backbone=GPT-5.22026.02 | 35.4 | 0.384 | 0.371 | 0.37 | |
| DCLLM Backbone=GPT-5.22026.02 | 35.3 | 0.384 | 0.371 | 0.36 | |
| ReasoningbankLLM Backbone=GPT-5.22026.02 | 35.1 | 0.36 | 0.354 | 0.348 | |
| MementoLLM Backbone=Qwen3-32B2026.02 | 34.9 | 0.386 | 0.372 | 0.372 | |
| TAMELLM Backbone=Qwen3-32B2026.02 | 34.9 | 0.357 | 0.373 | 0.382 | |
| ReasoningbankLLM Backbone=Qwen3-32B2026.02 | 34.8 | 0.355 | 0.352 | 0.349 | |
| DCLLM Backbone=Qwen3-32B2026.02 | 34.2 | 0.365 | 0.354 | 0.34 | |
| TAMELLM Backbone=GPT-5.22026.02 | 33.3 | 0.384 | 0.387 | 0.371 | |
| No-MemoryLLM Backbone=Qwen3-32B2026.02 | 28.4 | — | — | — | |
| No-MemoryLLM Backbone=GPT-5.22026.02 | 28.4 | — | — | — |