Sentence-level error detection on DeltaBench CoT Diagnosis 1.0 (test)
43.2PrecisionGPT-5 (BIG-Bench Prompt)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5 (BIG-Bench Prompt)Base Model=GPT-5, Prompting Template=BIG-Bench Prompt2026.03 | 43.2 | 65.8 | 47 | |
| ReasonDiagBase Model=GPT-52026.03 | 30.6 | 80.1 | 38.6 | |
| GPT-5 (DeltaBench Prompt)Base Model=GPT-5, Prompting Template=DeltaBench Prompt2026.03 | 5.1 | 4.1 | 4.4 |