Reasoning Correction on CyberCorrect-Bench
79.8AccuracyCyberCorrect
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| CyberCorrectMaximum correction iterations (Tmax)=3, confidence threshold (φ)=40, detection threshold (σ)=0.32026.05 | 79.8 | 68.7 | 81.2 | 8.2 | 3.6 | |
| CoVemode=chain-of-verification2026.05 | 73.6 | 58.3 | 71.4 | 13.9 | 8.4 | |
| Reflexionmode=verbal reinforcement learning2026.05 | 71.9 | 54.2 | 65.7 | 16.1 | 9.8 | |
| Self-Refinemode=iterative self-feedback refinement2026.05 | 70.3 | 51.8 | 62.1 | 18.3 | 11.2 | |
| Self-Consistencysamples (K)=52026.05 | 67.5 | — | — | — | — | |
| Naive-Retryprompt=please reconsider2026.05 | 61.2 | 32.4 | 48.3 | 22.7 | 14.5 | |
| No-Correctionmode=Direct LLM output2026.05 | 58.4 | — | — | — | — |