LLM-as-a-Judge Evaluation on Average Across FB Bench, FLASK, Vic. Bench, MT Bench
71Pearson (r)Qwen3-32B REAL (ours)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-32B REAL (ours)Training=RL, Inference=RAIL2026.03 | 71 | 70 | 60 | |
| Mistral2-7B REAL (ours)Training=RL, Inference=RAIL2026.03 | 67.9 | 66.2 | 53 | |
| Qwen3-8B REAL (ours)Training=RL, Inference=RAIL2026.03 | 67 | 66 | 56.1 | |
| Mistral2-7B Standard RLTraining=RL, Inference=RAIL2026.03 | 64.1 | 62.7 | 50.3 | |
| Mistral2-7B TRACTTraining=SFT, Inference=RAIL2026.03 | 63.2 | 62.2 | 49.8 | |
| Qwen3-8B Standard RLTraining=RL, Inference=RAIL2026.03 | 63.2 | 64 | 51.4 | |
| Qwen3-8B TRACTTraining=SFT, Inference=RAIL2026.03 | 63.1 | 63.8 | 51.2 | |
| Qwen3-32B RAFTTraining=SFT, Inference=RAIL2026.03 | 62.6 | 62.8 | 49.2 | |
| Qwen3-8B RAFTTraining=SFT, Inference=RAIL2026.03 | 61.9 | 61.1 | 48.3 | |
| Prometheus-2-7BTraining=SFT, Inference=RAIL2026.03 | 60.7 | 59.8 | 47.8 | |
| Prometheus-2-7BTraining=SFT, Inference=Standard2026.03 | 59.1 | 57.6 | 49.3 | |
| Prometheus-1-13BTraining=SFT, Inference=Standard2026.03 | 56.7 | 54.8 | 45.1 | |
| Mistral2-7B RAFTTraining=SFT, Inference=RAIL2026.03 | 55.6 | 55.8 | 44.8 | |
| Qwen3-32B BaseTraining=None, Inference=RAIL2026.03 | 52.7 | 58.8 | 46.1 | |
| Mistral2-7B Base (w/ warmup)Training=None, Inference=RAIL2026.03 | 52.1 | 50.8 | 39.5 | |
| Mistral2-7B Base (w/ warmup)Training=None, Inference=Standard2026.03 | 51.2 | 49.8 | 42.6 | |
| Prometheus-1-7BTraining=SFT, Inference=Standard2026.03 | 49.1 | 49.3 | 40.8 | |
| Qwen3-8B BaseTraining=None, Inference=RAIL2026.03 | 43.7 | 48.8 | 39.5 | |
| Qwen3-8B BaseTraining=None, Inference=Standard2026.03 | 43.6 | 47.4 | 40.3 | |
| GPT-3.5-Turbo-0613Training=None, Inference=Standard2026.03 | 38.3 | 34.8 | 28.5 |