Spoken Language Practice on spoken practice (evaluation)
55.26Vocabulary ScoreLlama3.1-8B Base
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Llama3.1-8B BaseModel Series=Llama3.1-8B, Configuration=Base2026.04 | 55.26 | 72 | 4.98 | 3.58 | 3.9 | 4.48 | 4.23 | |
| Qwen2.5-7B + PromptModel Series=Qwen2.5-7B, Configuration=Prompting2026.04 | 45.43 | 64 | 4.97 | 3.41 | 3.7 | 4.54 | 4.15 | |
| Qwen2.5-7B BaseModel Series=Qwen2.5-7B, Configuration=Base2026.04 | 41.69 | 66 | 4.97 | 3.21 | 3.58 | 4.5 | 4.06 | |
| Qwen2.5-7B + SFTModel Series=Qwen2.5-7B, Configuration=Supervised Fine-Tuning2026.04 | 23.18 | 76 | 4.98 | 3.33 | 3.51 | 4.47 | 4.07 | |
| Llama3.1-8B + SFTModel Series=Llama3.1-8B, Configuration=Supervised Fine-Tuning2026.04 | 19.9 | 74 | 4.99 | 3.6 | 3.48 | 4.51 | 4.14 | |
| Qwen2.5-7B + DecodingModel Series=Qwen2.5-7B, Configuration=Decoding2026.04 | 9.36 | 65 | 4.95 | 3.1 | 3.47 | 4.49 | 4 | |
| Qwen2.5-7B + DDPOModel Series=Qwen2.5-7B, Configuration=Diversity Driven Policy Optimization2026.04 | 9.36 | 72 | 4.96 | 3.63 | 3.64 | 4.87 | 4.3 | |
| Llama3.1-8B + DDPOModel Series=Llama3.1-8B, Configuration=Diversity Driven Policy Optimization2026.04 | 6.79 | 72 | 4.94 | 3.8 | 3.79 | 4.84 | 4.34 |