Multi-turn Conversation Evaluation on EduFeedback alternate
8.3MT-Bench ScoreSFT
Evaluation Results
| Method | Links | |
|---|---|---|
| SFTBase Model=DOLPHIN-7B2026.05 | 8.3 | |
| DPOBase Model=DOLPHIN-7B2026.05 | 8.3 | |
| SFTBase Model=MISTRAL-7B2026.05 | 8.1 | |
| COALABase Model=DOLPHIN-7B2026.05 | 8.1 | |
| COALABase Model=LLAMA-8B2026.05 | 8 | |
| SFTBase Model=LLAMA-8B2026.05 | 7.9 | |
| DPOBase Model=LLAMA-8B2026.05 | 7.9 | |
| ORPOBase Model=DOLPHIN-7B2026.05 | 7.9 | |
| ORPOBase Model=LLAMA-8B2026.05 | 7.8 | |
| COALABase Model=MISTRAL-7B2026.05 | 6.9 | |
| ORPOBase Model=MISTRAL-7B2026.05 | 6.8 | |
| DPOBase Model=MISTRAL-7B2026.05 | 6.1 | |
| SFTBase Model=GPT-22026.05 | 1.7 | |
| COALABase Model=DISTILGPT2026.05 | 1.7 | |
| SFTBase Model=DISTILGPT2026.05 | 1.6 | |
| ORPOBase Model=GPT-22026.05 | 1.6 | |
| COALABase Model=GPT-22026.05 | 1.6 | |
| DPOBase Model=GPT-22026.05 | 1.3 | |
| DPOBase Model=DISTILGPT2026.05 | 1 | |
| ORPOBase Model=DISTILGPT2026.05 | 1 |