LLM-as-a-judge evaluation on FB Bench (Feedback Bench)
0.949Pearson's rQwen3-8B TRACT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-8B TRACTTraining=SFT, Inference=RAIL2026.03 | 0.949 | 0.947 | 0.843 | |
| Qwen3-8B Standard RLTraining=RL, Inference=RAIL2026.03 | 0.94 | 0.942 | 0.835 | |
| Mistral2-7B TRACTTraining=SFT, Inference=RAIL2026.03 | 0.939 | 0.937 | 0.829 | |
| Mistral2-7B Standard RLTraining=RL, Inference=RAIL2026.03 | 0.937 | 0.937 | 0.828 | |
| Mistral-7B-Instruct (RAFT on GPT-4)Backbone=Mistral-7B-Instruct, CoT=false, Train Objective=RAFT†, Training Data=GPT-4†, Inference Method=RAIL2025.03 | 0.932 | 0.93 | — | |
| Mistral2-7B REAL (ours)Training=RL, Inference=RAIL2026.03 | 0.932 | 0.934 | 0.825 | |
| TRACTBackbone=Mistral-7B-Instruct, CoT=true, Train Objective=C-RAFT, Training Data=Self, Inference Method=C-RAIL2025.03 | 0.931 | 0.93 | — | |
| Baseline B.4 (RAFT)Backbone=Llama3.1-8B, COT=false, Train=RAFT, Data=GPT-4+, Inf=RAIL2025.03 | 0.92 | 0.918 | — | |
| TRACTBackbone=Llama3.1-8B, COT=true, Train=C-RAFT, Data=Self, Inf=C-RAIL2025.03 | 0.92 | 0.917 | — | |
| Qwen3-8B REAL (ours)Training=RL, Inference=RAIL2026.03 | 0.92 | 0.921 | 0.857 | |
| TRACT (Ablation: Objective CE)Backbone=Mistral-7B-Instruct, CoT=true, Train Objective=CE, Training Data=Self, Inference Method=C-RAIL2025.03 | 0.919 | 0.917 | — | |
| Qwen3-32B REAL (ours)Training=RL, Inference=RAIL2026.03 | 0.911 | 0.917 | 0.859 | |
| Mistral-7B-Instruct (CE on GPT-4 scores)Backbone=Mistral-7B-Instruct, CoT=false, Train Objective=CE, Training Data=GPT-4†, Inference Method=Decode2025.03 | 0.89 | 0.891 | — | |
| TRACT (Ablation: Data GPT-4)Backbone=Mistral-7B-Instruct, CoT=true, Train Objective=C-RAFT, Training Data=GPT-4, Inference Method=C-RAIL2025.03 | 0.879 | 0.88 | — | |
| Mistral2-7B RAFTTraining=SFT, Inference=RAIL2026.03 | 0.879 | 0.88 | 0.763 | |
| Mistral-7B-Instruct (CE on Self-gen CoT)Backbone=Mistral-7B-Instruct, CoT=true, Train Objective=CE, Training Data=Self, Inference Method=Decode2025.03 | 0.873 | 0.873 | — | |
| Mistral-7B-Instruct (CE on GPT-4 CoT)Backbone=Mistral-7B-Instruct, CoT=true, Train Objective=CE, Training Data=GPT-4, Inference Method=Decode2025.03 | 0.872 | 0.872 | — | |
| Prometheus-1-13BTraining=SFT, Inference=Standard2026.03 | 0.86 | 0.858 | 0.771 | |
| Baseline B.1 (CE)Backbone=Llama3.1-8B, COT=false, Train=CE, Data=GPT-4, Inf=Decode2025.03 | 0.857 | 0.857 | — | |
| Qwen3-32B RAFTTraining=SFT, Inference=RAIL2026.03 | 0.854 | 0.865 | 0.729 | |
| Prometheus-2-7BTraining=SFT, Inference=RAIL2026.03 | 0.853 | 0.853 | 0.729 | |
| Prometheus-1-7BTraining=SFT, Inference=Standard2026.03 | 0.847 | 0.849 | 0.767 | |
| Prometheus-2-7BBackbone=Prometheus-2-7B, Inference Method=Decode2025.03 | 0.845 | 0.847 | — | |
| Prometheus-2-7BTraining=SFT, Inference=Standard2026.03 | 0.845 | 0.847 | 0.765 | |
| Qwen3-8B RAFTTraining=SFT, Inference=RAIL2026.03 | 0.843 | 0.855 | 0.73 | |
| Mistral2-7B Base (w/ warmup)Training=None, Inference=RAIL2026.03 | 0.837 | 0.843 | 0.702 | |
| Baseline B.2 (CE)Backbone=Llama3.1-8B, COT=true, Train=CE, Data=GPT-4, Inf=Decode2025.03 | 0.835 | 0.834 | — | |
| Mistral2-7B Base (w/ warmup)Training=None, Inference=Standard2026.03 | 0.831 | 0.833 | 0.748 | |
| Baseline B.3 (RAIL)Backbone=Llama3.1-8B, COT=false, Inf=RAIL2025.03 | 0.683 | 0.689 | — | |
| TRACT (Ablation: Stage 1 Init)Backbone=Mistral-7B-Instruct, Note=Stage 2 initialized from ps, CoT=true2025.03 | 0.674 | 0.684 | — | |
| Qwen3-32B BaseTraining=None, Inference=RAIL2026.03 | 0.634 | 0.708 | 0.567 | |
| Qwen3-8B BaseTraining=None, Inference=RAIL2026.03 | 0.567 | 0.654 | 0.541 | |
| Qwen3-8B BaseTraining=None, Inference=Standard2026.03 | 0.566 | 0.627 | 0.539 | |
| GPT-3.5-Turbo-0613Training=None, Inference=Standard2026.03 | 0.563 | 0.521 | 0.453 | |
| CLoud (Reward model)Backbone=Llama-3-8B, Inference Method=Decode*2025.03 | 0.381 | 0.376 | — | |
| Mistral-7B-Instruct (Zero-shot RAIL)Backbone=Mistral-7B-Instruct, CoT=false, Inference Method=RAIL2025.03 | 0.197 | 0.175 | — |