Preference Modeling on HH-RLHF
61.4AccuracyLLM-Judge
Evaluation Results
| Method | Links | |
|---|---|---|
| LLM-JudgeBackbone Model=GPT-OSS-20B, Budget=N=42026.05 | 61.4 | |
| UABBackbone Model=Gemma3-27B, Budget=N=42026.05 | 60.8 | |
| UABBackbone Model=Cohere, Budget=N=42026.05 | 60.8 | |
| UABBackbone Model=GPT-OSS-20B, Budget=N=42026.05 | 60.6 | |
| LLM-JudgeBackbone Model=Gemma3-27B, Budget=N=42026.05 | 60.2 | |
| UniformBackbone Model=GPT-OSS-20B, Budget=N=42026.05 | 60.1 | |
| N=1Backbone Model=Cohere, Budget=N=12026.05 | 60 | |
| UniformBackbone Model=Cohere, Budget=N=42026.05 | 59.7 | |
| N=1Backbone Model=GPT-OSS-20B, Budget=N=12026.05 | 59.4 | |
| UniformBackbone Model=Gemma3-27B, Budget=N=42026.05 | 59.4 | |
| N=1Backbone Model=Gemma3-27B, Budget=N=12026.05 | 59.1 | |
| LLM-JudgeBackbone Model=Cohere, Budget=N=42026.05 | 58.7 | |
| UABModel=Llama3.2-3B, N=42026.05 | 54.3 | |
| UABModel=Qwen2.5-7B, N=42026.05 | 53.2 | |
| LengthModel=Qwen2.5-7B, N=42026.05 | 53 | |
| LLM-JudgeModel=Qwen2.5-7B, N=42026.05 | 53 | |
| N=1Model=Qwen2.5-7B, N=12026.05 | 52.8 | |
| UniformModel=Llama3.2-3B, N=42026.05 | 52.2 | |
| UABModel=Qwen2.5-1.5B, N=42026.05 | 51.7 | |
| LengthModel=Llama3.2-3B, N=42026.05 | 51.3 | |
| RandomModel=Qwen2.5-7B, N=42026.05 | 51.3 | |
| N=1Model=Qwen2.5-1.5B, N=12026.05 | 50.9 | |
| RandomModel=Llama3.2-3B, N=42026.05 | 50.5 | |
| UniformModel=Qwen2.5-7B, N=42026.05 | 50.5 | |
| LengthModel=Qwen2.5-1.5B, N=42026.05 | 50.4 | |
| LLM-JudgeModel=Qwen2.5-1.5B, N=42026.05 | 50.2 | |
| LLM-JudgeModel=Llama3.2-3B, N=42026.05 | 49.2 | |
| UniformModel=Qwen2.5-1.5B, N=42026.05 | 48.2 | |
| RandomModel=Qwen2.5-1.5B, N=42026.05 | 46.6 | |
| N=1Model=Llama3.2-3B, N=12026.05 | 45.2 |