Dialogue State Transition on PFDial OOD (test)
96.31AccQwen2.5-7B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-7BTraining Approach=Integrated Training2025.03 | 96.31 | 96.96 | 92.33 | |
| Qwen2.5-3BTraining Approach=Integrated Training2025.03 | 94.57 | 96.18 | 84.65 | |
| Qwen2.5-1.5BTraining Approach=Integrated Training2025.03 | 93.87 | 94.82 | 88.01 | |
| Qwen2.5-0.5BTraining Approach=Integrated Training2025.03 | 92.76 | 93.22 | 89.93 | |
| Qwen2.5-1.5BTraining Approach=Secondary Fine-tuning2025.03 | 87.9 | 88.82 | 82.25 | |
| GPT-4oTraining Approach=Baselines2025.03 | 86.29 | 51.8 | 91.9 | |
| GPT-3.5-TurboTraining Approach=Baselines2025.03 | 79.76 | 39.57 | 86.29 | |
| Qwen2.5-3BTraining Approach=Secondary Fine-tuning2025.03 | 79.73 | 80.91 | 72.42 | |
| DeepSeek-v3Training Approach=Baselines2025.03 | 79.02 | 47.72 | 84.11 | |
| Qwen2.5-7BTraining Approach=Secondary Fine-tuning2025.03 | 76.04 | 76.82 | 71.22 | |
| Gemini-2.0-Flash-ExpTraining Approach=Baselines2025.03 | 75.17 | 47.48 | 79.66 | |
| Qwen2.5-7B-InstructTraining Approach=Baselines2025.03 | 65.87 | 37.88 | 71.34 | |
| Claude-3.5-SonnetTraining Approach=Baselines2025.03 | 62.74 | 22.06 | 69.4 | |
| Qwen2.5-0.5BTraining Approach=Secondary Fine-tuning2025.03 | 50.77 | 52.67 | 39.09 | |
| LLaMA-3.1-8B-InstructTraining Approach=Baselines2025.03 | 13.2 | 2.16 | 15 |