LLM-as-a-Judge Evaluation on Coding Qwen (n=8884)
77.74Adjusted AccuracyAURA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AURAJudge Model=Qwen, Original Judge Accuracy=53.73%, Verification Data Budget (%)=adaptive2026.06 | 77.74 | 24.02 | 278.8 | |
| Random ForestJudge Model=Qwen, Original Judge Accuracy=53.73%, Verification Data Budget (%)=20%2026.06 | 59.2 | 5.47 | 1,777 | |
| Logistic Reg.Judge Model=Qwen, Original Judge Accuracy=53.73%, Verification Data Budget (%)=20%2026.06 | 58.47 | 4.75 | 1,777 | |
| MLPJudge Model=Qwen, Original Judge Accuracy=53.73%, Verification Data Budget (%)=20%2026.06 | 57.44 | 3.72 | 1,777 | |
| Label Prop.Judge Model=Qwen, Original Judge Accuracy=53.73%, Verification Data Budget (%)=20%2026.06 | 53.77 | 0.04 | 1,777 |