LLM-as-a-Judge Evaluation on Vicuna Benchmark
65.1Pearson Correlation (r)Qwen3-32B REAL (ours)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-32B REAL (ours)Training=RL, Inference=RAIL2026.03 | 65.1 | 60.7 | 51.2 | |
| Mistral2-7B REAL (ours)Training=RL, Inference=RAIL2026.03 | 63.3 | 60.2 | 46.3 | |
| Qwen3-8B REAL (ours)Training=RL, Inference=RAIL2026.03 | 60.5 | 57.8 | 48.2 | |
| Qwen3-8B RAFTTraining=SFT, Inference=RAIL2026.03 | 59.9 | 57.2 | 44 | |
| Mistral2-7B Standard RLTraining=RL, Inference=RAIL2026.03 | 58 | 56 | 43.4 | |
| Qwen3-8B Standard RLTraining=RL, Inference=RAIL2026.03 | 57.1 | 56.1 | 43 | |
| Mistral2-7B TRACTTraining=SFT, Inference=RAIL2026.03 | 56.2 | 54.8 | 42.6 | |
| Mistral2-7B RAFTTraining=SFT, Inference=RAIL2026.03 | 52.8 | 51.3 | 40.9 | |
| Qwen3-32B RAFTTraining=SFT, Inference=RAIL2026.03 | 51.9 | 52 | 39.9 | |
| Prometheus-2-7BTraining=SFT, Inference=RAIL2026.03 | 51 | 51.3 | 40.3 | |
| Qwen3-32B BaseTraining=None, Inference=RAIL2026.03 | 50.8 | 57.4 | 45 | |
| Qwen3-8B TRACTTraining=SFT, Inference=RAIL2026.03 | 50.5 | 50.4 | 38.3 | |
| Mistral2-7B Base (w/ warmup)Training=None, Inference=RAIL2026.03 | 50.3 | 45.4 | 34 | |
| Mistral2-7B Base (w/ warmup)Training=None, Inference=Standard2026.03 | 49.2 | 42.4 | 36.1 | |
| Prometheus-2-7BTraining=SFT, Inference=Standard2026.03 | 48.8 | 48 | 41.1 | |
| Prometheus-1-13BTraining=SFT, Inference=Standard2026.03 | 47.3 | 45.1 | 34.1 | |
| Qwen3-8B BaseTraining=None, Inference=Standard2026.03 | 37.3 | 46.5 | 40.8 | |
| Qwen3-8B BaseTraining=None, Inference=RAIL2026.03 | 37.3 | 46.1 | 38.6 | |
| Prometheus-1-7BTraining=SFT, Inference=Standard2026.03 | 29.3 | 29.5 | 21.6 | |
| GPT-3.5-Turbo-0613Training=None, Inference=Standard2026.03 | 27.5 | 26.7 | 20.2 |