LLM-as-a-judge Evaluation on Coding GPT-5.4
67.2Adjusted AccuracyAURA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AURAJudge Model=GPT-5.4, Original Judge Accuracy=63.92%, Verification Data Budget (%)=adaptive2026.06 | 67.2 | 3.28 | 100.6 | |
| Random ForestJudge Model=GPT-5.4, Original Judge Accuracy=63.92%, Verification Data Budget (%)=20%2026.06 | 63.23 | -0.69 | 590 | |
| MLPJudge Model=GPT-5.4, Original Judge Accuracy=63.92%, Verification Data Budget (%)=20%2026.06 | 60.83 | -3.09 | 590 | |
| Label Prop.Judge Model=GPT-5.4, Original Judge Accuracy=63.92%, Verification Data Budget (%)=20%2026.06 | 60.5 | -3.42 | 590 | |
| Logistic Reg.Judge Model=GPT-5.4, Original Judge Accuracy=63.92%, Verification Data Budget (%)=20%2026.06 | 59.54 | -4.38 | 590 |