Explanation Refinement on PrOntoQA
0.98Initial ScoreLLM-TP Tree
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLM-TP TreeBackbone=Qwen3-max2026.01 | 0.98 | 1 | |
| LLM-TP TreeBackbone=Deepseek-V3.12026.01 | 0.9733 | 1 | |
| LLM-TP TreeBackbone=GPT-5 nano2026.01 | 0.9333 | 0.98 | |
| LLM-TP TreeBackbone=GPT-4o2026.01 | 0.92 | 0.9733 | |
| LLM-TP TreeBackbone=Grok-4 fast2026.01 | 0.86 | 0.9133 | |
| Faithful-RefinerBackbone=Deepseek-V3.12026.01 | 0.8533 | 0.9133 | |
| Faithful-RefinerBackbone=GPT-4o2026.01 | 0.8267 | 0.9 | |
| Faithful-RefinerBackbone=Qwen3-max2026.01 | 0.82 | 0.9133 | |
| Faithful-RefinerBackbone=GPT-5 nano2026.01 | 0.7333 | 0.8 | |
| Faithful-RefinerBackbone=Grok-4 fast2026.01 | 0.72 | 0.84 | |
| Explanation-RefinerBackbone=Qwen3-max2026.01 | 0.6467 | 0.78 | |
| Explanation-RefinerBackbone=GPT-4o2026.01 | 0.64 | 0.7867 | |
| Explanation-RefinerBackbone=Deepseek-V3.12026.01 | 0.62 | 0.74 | |
| Explanation-RefinerBackbone=Grok-4 fast2026.01 | 0.6133 | 0.7333 | |
| Explanation-RefinerBackbone=GPT-5 nano2026.01 | 0.6 | 0.7467 |