LLM-as-Judge evaluation on HH dataset
59.1WCWRRMOD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RMODJudge=gpt-4o, Block Size (B)=16, Number of Candidates (K)=162025.03 | 59.1 | 27.73 | |
| DISTILL-RMODJudge=gpt-4o, Number of Candidates (K)=12025.03 | 57.9 | 8.48 | |
| CD-UNIFORMJudge=gpt-4o, Block Size (B)=16, Number of Candidates (K)=162025.03 | 57.6 | 28.14 | |
| MO-GRPOJudge=gpt-4o, Number of Candidates (K)=12025.03 | 54.6 | 336.08 | |
| MO-DPOJudge=gpt-4o, Number of Candidates (K)=12025.03 | 52.8 | 0.5 |