Explanation Refinement on ProofWriter
92Initial ScoreLLM-TP Tree
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLM-TP TreeBackbone=Qwen3-max2026.01 | 92 | 98 | |
| LLM-TP TreeBackbone=GPT-4o2026.01 | 91.33 | 95.33 | |
| LLM-TP TreeBackbone=Deepseek-V3.12026.01 | 91.33 | 98 | |
| LLM-TP TreeBackbone=GPT-5 nano2026.01 | 85.33 | 91.33 | |
| Faithful-RefinerBackbone=Qwen3-max2026.01 | 84 | 91.33 | |
| Faithful-RefinerBackbone=Deepseek-V3.12026.01 | 83.33 | 90.67 | |
| Faithful-RefinerBackbone=GPT-4o2026.01 | 80 | 86.67 | |
| LLM-TP TreeBackbone=Grok-4 fast2026.01 | 72.67 | 90 | |
| Faithful-RefinerBackbone=GPT-5 nano2026.01 | 72 | 84.67 | |
| Explanation-RefinerBackbone=Qwen3-max2026.01 | 64 | 78 | |
| Explanation-RefinerBackbone=GPT-4o2026.01 | 62.67 | 76.67 | |
| Faithful-RefinerBackbone=Grok-4 fast2026.01 | 60 | 78.67 | |
| Explanation-RefinerBackbone=GPT-5 nano2026.01 | 59.33 | 73.33 | |
| Explanation-RefinerBackbone=Grok-4 fast2026.01 | 53.33 | 69.33 | |
| Explanation-RefinerBackbone=Deepseek-V3.12026.01 | 52.67 | 66.67 |