LLM-as-a-Judge on BigGen-Bench (test)
0.312Pearson CorrelationLLaDA (FS)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LLaDA (FS)Train=FS, Prompt Template=Judge Infill2026.04 | 0.312 | 0.548 | 0.263 | 3.73 | |
| LLaDA (FS+RO)Train=FS+RO, Prompt Template=Judge Infill2026.04 | 0.259 | 0.525 | 0.21 | 3.78 | |
| LLaDA (RO)Train=RO, Prompt Template=Judge Infill2026.04 | 0.205 | 0.406 | 0.168 | 7.14 | |
| LLaDA (Public)Train=Public, Prompt Template=Judge Infill2026.04 | -0.007 | 0.078 | 0.068 | 7.4 |