Structured Reasoning and Evaluation on MT-Eval
95.56CSRGraphIF
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GraphIFBackbone Model=Llama-3.1-70B-Instruct2025.11 | 95.56 | 87.77 | 95.43 | 96.89 | |
| GraphIFBackbone Model=GPT-4o-mini2025.11 | 93.03 | 79.89 | 92.8 | 95.58 | |
| Qwen2.5-7B+GraphIFBackbone=Qwen2.5-7B, Technique=GraphIF2025.11 | 91.3 | 76.96 | 91.06 | 90.72 | |
| LLM-onlyBackbone Model=GPT-4o-mini2025.11 | 90.65 | 74.78 | 90.3 | 93.86 | |
| LLM-onlyBackbone Model=Llama-3.1-70B-Instruct2025.11 | 83.99 | 60.7 | 83.56 | 83.99 | |
| Qwen2.5-7B-onlyBackbone=Qwen2.5-7B2025.11 | 80.22 | 51.3 | 79.7 | 79.57 | |
| Qwen2.5-7B+Self-RefineBackbone=Qwen2.5-7B, Technique=Self-Refine2025.11 | 68.7 | 26.52 | 68.03 | 65.62 | |
| MemAgent-7BBackbone=7B2025.11 | 65.72 | 25.22 | 65.15 | 65.1 |