Dialogue on MT-Bench (test)
8.36GPT-4 ScoreLoRA
Evaluation Results
| Method | Links | |
|---|---|---|
| LoRABackbone Model=Deepseek R1-1.5B, Trainable Parameters=1.21M2025.12 | 8.36 | |
| FAABackbone Model=Deepseek R1-1.5B, Trainable Parameters=1.63M2025.12 | 8.35 | |
| FFBackbone Model=Deepseek R1-1.5B, Trainable Parameters=1.5B2025.12 | 8.34 | |
| FourierFTBackbone Model=Deepseek R1-1.5B, Trainable Parameters=0.15M2025.12 | 8.33 | |
| AdapterHBackbone Model=Deepseek R1-1.5B, Trainable Parameters=1.63M2025.12 | 8.32 | |
| FFBackbone Model=LLaMA3 8B, Trainable Parameters=8.03B2025.12 | 8.17 | |
| FFBackbone Model=Qwen2 7B, Trainable Parameters=7.07B2025.12 | 7.88 | |
| LoRABackbone Model=Qwen2 7B, Trainable Parameters=5.40M2025.12 | 7.86 | |
| FAABackbone Model=Qwen2 7B, Trainable Parameters=7.30M2025.12 | 7.82 | |
| FourierFTBackbone Model=Qwen2 7B, Trainable Parameters=0.85M2025.12 | 7.81 | |
| AdapterHBackbone Model=Qwen2 7B, Trainable Parameters=7.29M2025.12 | 7.78 | |
| AdapterHBackbone Model=LLaMA3 8B, Trainable Parameters=8.73M2025.12 | 7.48 | |
| FAABackbone Model=LLaMA3 8B, Trainable Parameters=8.73M2025.12 | 7.45 | |
| FourierFTBackbone Model=LLaMA3 8B, Trainable Parameters=0.91M2025.12 | 7.41 | |
| LoRABackbone Model=LLaMA3 8B, Trainable Parameters=6.47M2025.12 | 7.4 | |
| GRPO + R2MBackbone=LLaMA3-8B-Instruct2026.01 | 7.3 | |
| RLOO + R2MBackbone=LLaMA3-8B-Instruct2026.01 | 7.3 | |
| GRPO + Pretrained RMBackbone=LLaMA3-8B-Instruct2026.01 | 7.1 | |
| RLOOBackbone=LLaMA3-8B-Instruct2026.01 | 7.1 | |
| RLOO + Pretrained RMBackbone=LLaMA3-8B-Instruct2026.01 | 7.1 | |
| ReMaxBackbone=LLaMA3-8B-Instruct2026.01 | 7 | |
| GRPOBackbone=LLaMA3-8B-Instruct2026.01 | 7 | |
| GRPO + Iterative RMHeadBackbone=LLaMA3-8B-Instruct2026.01 | 7 | |
| RLOO + Iterative RMHeadBackbone=LLaMA3-8B-Instruct2026.01 | 7 | |
| SFTBackbone=LLaMA3-8B-Instruct2026.01 | 6.9 | |
| REINFORCE++Backbone=LLaMA3-8B-Instruct2026.01 | 6.8 | |
| RLOO + R2MBackbone=Qwen2.5-3B-Instruct2026.01 | 6.7 | |
| GRPO + R2M w/o TrainBackbone=LLaMA3-8B-Instruct2026.01 | 6.7 | |
| GRPO + R2MBackbone=Qwen2.5-3B-Instruct2026.01 | 6.6 | |
| GRPO + Iterative RMHeadBackbone=Qwen2.5-3B-Instruct2026.01 | 6.5 | |
| RLOO + Pretrained RMBackbone=Qwen2.5-3B-Instruct2026.01 | 6.5 | |
| RLOO + Iterative RMHeadBackbone=Qwen2.5-3B-Instruct2026.01 | 6.5 | |
| RLOO + R2M w/o TrainBackbone=LLaMA3-8B-Instruct2026.01 | 6.5 | |
| SFTBackbone=Qwen2.5-3B-Instruct2026.01 | 6.4 | |
| ReMaxBackbone=Qwen2.5-3B-Instruct2026.01 | 6.4 | |
| GRPO + Pretrained RMBackbone=Qwen2.5-3B-Instruct2026.01 | 6.4 | |
| RLOOBackbone=Qwen2.5-3B-Instruct2026.01 | 6.4 | |
| REINFORCE++Backbone=Qwen2.5-3B-Instruct2026.01 | 6.3 | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.01 | 6.3 | |
| GRPO + R2M w/o TrainBackbone=Qwen2.5-3B-Instruct2026.01 | 6.2 | |
| RLOO + R2M w/o TrainBackbone=Qwen2.5-3B-Instruct2026.01 | 6.2 | |
| FAABackbone Model=LLaMA2 7B, Trainable Parameters=7.27M2025.12 | 5.24 | |
| AdapterHBackbone Model=LLaMA2 7B, Trainable Parameters=7.27M2025.12 | 5.23 | |
| LoRABackbone Model=LLaMA2 7B, Trainable Parameters=5.37M2025.12 | 5.22 | |
| FourierFTBackbone Model=LLaMA2 7B, Trainable Parameters=0.82M2025.12 | 5.21 | |
| FFBackbone Model=LLaMA2 7B, Trainable Parameters=6.94B2025.12 | 5.19 |