Document editing and consistency verification on Curated benchmark 1,900 test cases
80.12ConsistencyLEDGER
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| LEDGERModel=Claude Haiku 4.52026.06 | 80.12 | 80.36 | 83.05 | 84.27 | 1,479 | |
| LEDGERModel=GPT-5.2-High2026.06 | 77.44 | 74.61 | 75.38 | 75.92 | 1,683 | |
| LEDGERModel=GPT-5 Chat2026.06 | 77.08 | 74.19 | 76.42 | 82.11 | 1,489 | |
| LEDGERModel=Claude Opus 4.52026.06 | 75.42 | 77.18 | 78.34 | 77.66 | 1,508 | |
| LEDGERModel=GPT-4.12026.06 | 74.53 | 81.29 | 79.16 | 74.84 | 1,478 | |
| LEDGERModel=Claude Sonnet 4.52026.06 | 74.31 | 72.44 | 70.26 | 73.58 | 1,575 | |
| Full Doc.Model=Claude Opus 4.52026.06 | 61.17 | 69.53 | 70.28 | 43.61 | 1,736 | |
| Full Doc.Model=GPT-5.2-High2026.06 | 57.59 | 67.33 | 71.14 | 45.26 | 1,910 | |
| Full Doc.Model=GPT-5 Chat2026.06 | 57.36 | 66.24 | 68.57 | 41.63 | 1,825 | |
| Full Doc.Model=Claude Sonnet 4.52026.06 | 55.48 | 58.62 | 67.19 | 36.54 | 1,725 | |
| Full Doc.Model=GPT-4.12026.06 | 54.69 | 60.71 | 62.44 | 43.22 | 1,974 | |
| Full Doc.Model=Claude Haiku 4.52026.06 | 53.23 | 63.41 | 63.18 | 35.72 | 1,759 |