Reasoning failure prediction on CodeLingua (L2)
75Accuracythought-tree-based classifier
Evaluation Results
| Method | Links | |
|---|---|---|
| thought-tree-based classifierTarget Reasoning Model=R1, Evaluation Protocol=Generalization from L1 training2026.04 | 75 | |
| thought-tree-based classifierTarget Reasoning Model=QwQ, Evaluation Protocol=Generalization from L1 training2026.04 | 68 |