Meta-reasoning quality assessment on APPS
85.6ThoroughnessMCTS-Judge
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MCTS-JudgeBase Model=Qwen2.5-Coder-14B-Instruct, Comparison Baseline=o1-mini, Judge Model=GPT-4o2025.02 | 85.6 | 77.3 | 84.1 | 53 | |
| MCTS-JudgeBase Model=Deepseek-Coder-V2-16B-Instruct, Comparison Baseline=o1-mini, Judge Model=GPT-4o2025.02 | 74.2 | 59.1 | 83.3 | 53.8 | |
| MCTS-JudgeBase Model=Deepseek-Coder-V2-16B-Instruct, Comparison Baseline=QwQ, Judge Model=GPT-4o2025.02 | 72 | 74.2 | 61.4 | 50.8 | |
| MCTS-JudgeBase Model=Qwen2.5-Coder-14B-Instruct, Comparison Baseline=o1-preview, Judge Model=GPT-4o2025.02 | 71.2 | 50.8 | 65.2 | 47.7 | |
| MCTS-JudgeBase Model=Qwen2.5-Coder-14B-Instruct, Comparison Baseline=QwQ, Judge Model=GPT-4o2025.02 | 68.9 | 56.8 | 59.9 | 56.1 | |
| MCTS-JudgeBase Model=Deepseek-Coder-V2-16B-Instruct, Comparison Baseline=o1-preview, Judge Model=GPT-4o2025.02 | 64.4 | 48.5 | 66.7 | 45.5 | |
| o1-previewComparison Context=Pairwise vs MCTS-Judge (Base: Deepseek-Coder-V2-16B-Instruct), Judge Model=GPT-4o2025.02 | 35.6 | 51.5 | 33.3 | 54.5 | |
| QwQComparison Context=Pairwise vs MCTS-Judge (Base: Qwen2.5-Coder-14B-Instruct), Judge Model=GPT-4o2025.02 | 31.1 | 43.2 | 40.1 | 43.9 | |
| o1-previewComparison Context=Pairwise vs MCTS-Judge (Base: Qwen2.5-Coder-14B-Instruct), Judge Model=GPT-4o2025.02 | 28.8 | 49.2 | 34.8 | 52.3 | |
| QwQComparison Context=Pairwise vs MCTS-Judge (Base: Deepseek-Coder-V2-16B-Instruct), Judge Model=GPT-4o2025.02 | 28 | 25.8 | 38.6 | 49.2 | |
| o1-miniComparison Context=Pairwise vs MCTS-Judge (Base: Deepseek-Coder-V2-16B-Instruct), Judge Model=GPT-4o2025.02 | 25.8 | 40.9 | 16.7 | 46.2 | |
| o1-miniComparison Context=Pairwise vs MCTS-Judge (Base: Qwen2.5-Coder-14B-Instruct), Judge Model=GPT-4o2025.02 | 14.4 | 22.7 | 15.9 | 47 |