Trustworthiness Evaluation on Trust-Memevo Science Domain
81.3No-MemoryReasoningbank
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ReasoningbankLLM Backbone=GPT-5.22026.02 | 81.3 | 0.799 | 0.783 | |
| MementoLLM Backbone=GPT-5.22026.02 | 80.9 | 0.727 | 0.695 | |
| TAMELLM Backbone=GPT-5.22026.02 | 80.1 | 0.841 | 0.788 | |
| Reasoningbank+promptLLM Backbone=GPT-5.22026.02 | 78.6 | 0.673 | 0.742 | |
| DCLLM Backbone=Qwen3-32B2026.02 | 78.4 | 0.627 | 0.691 | |
| MementoLLM Backbone=Qwen3-32B2026.02 | 78 | 0.721 | 0.768 | |
| Reasoningbank+GuardLLM Backbone=GPT-5.22026.02 | 77.4 | 0.771 | 0.852 | |
| DCLLM Backbone=GPT-5.22026.02 | 76 | 0.744 | 0.74 | |
| No-MemoryLLM Backbone=Qwen3-32B2026.02 | 72.9 | — | — | |
| TAMELLM Backbone=Qwen3-32B2026.02 | 72.3 | 0.717 | 0.787 | |
| Reasoningbank+GuardLLM Backbone=Qwen3-32B2026.02 | 69 | 0.674 | 0.707 | |
| No-MemoryLLM Backbone=GPT-5.22026.02 | 60.7 | — | — | |
| Reasoningbank+promptLLM Backbone=Qwen3-32B2026.02 | 58.9 | 0.642 | 0.613 | |
| ReasoningbankLLM Backbone=Qwen3-32B2026.02 | 57.9 | 0.565 | 0.559 |