Conversational Language Modeling on MT-Bench GPT-4 evaluator (test)
6.46MT-Bench ScoreFT-Adam
Evaluation Results
| Method | Links | |
|---|---|---|
| FT-AdamPre-trained=LLaMA-2-13B, Tuning=FT-Adam, Full-param=✓2023.10 | 6.46 | |
| FT-LionPre-trained=LLaMA-2-13B, Tuning=FT-Lion, Full-param=✓2023.10 | 6.44 | |
| FT-BnbPre-trained=LLaMA-2-13B, Tuning=FT-Bnb, Full-param=✓2023.10 | 6.3 | |
| QFTPre-trained=LLaMA-2-13B, Tuning=QFT (ours), Full-param=✓2023.10 | 6.27 | |
| FT-LionPre-trained=LLaMA-2-7B, Tuning=FT-Lion, Full-param=✓2023.10 | 6.11 | |
| FT-AdamPre-trained=LLaMA-2-7B, Tuning=FT-Adam, Full-param=✓2023.10 | 6.08 | |
| QFTPre-trained=LLaMA-2-7B, Tuning=QFT (ours), Full-param=✓2023.10 | 5.95 | |
| FT-BnbPre-trained=LLaMA-2-7B, Tuning=FT-Bnb, Full-param=✓2023.10 | 5.94 | |
| LoRAPre-trained=LLaMA-2-13B, Tuning=LoRA, Full-param=×2023.10 | 5.74 | |
| LoRAPre-trained=LLaMA-2-7B, Tuning=LoRA, Full-param=×2023.10 | 5.11 | |
| LLaMA-2-13BPre-trained=LLaMA-2-13B, Tuning=Pre-trained baseline2023.10 | 4.69 | |
| LLaMA-2-7BPre-trained=LLaMA-2-7B, Tuning=Pre-trained baseline2023.10 | 3.83 |