Dialogue State Transition Prediction on PFDial OOD 1.0 (test)
97.29AccLLaMA-3.1-8B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LLaMA-3.1-8BTraining Setting=Fine-tuned on PFDial2025.03 | 97.29 | 96.88 | 97.35 | |
| Qwen2.5-7BTraining Setting=Fine-tuned on PFDial2025.03 | 96.51 | 90.65 | 97.47 | |
| LLaMA-3.2-3BTraining Setting=Fine-tuned on PFDial2025.03 | 95.81 | 91.37 | 96.53 | |
| Qwen2.5-3BTraining Setting=Fine-tuned on PFDial2025.03 | 94.97 | 89.69 | 95.84 | |
| Qwen2.5-1.5BTraining Setting=Fine-tuned on PFDial2025.03 | 94 | 88.97 | 94.82 | |
| LLaMA-3.2-1BTraining Setting=Fine-tuned on PFDial2025.03 | 93.57 | 87.05 | 94.62 | |
| Qwen2.5-0.5BTraining Setting=Fine-tuned on PFDial2025.03 | 91.35 | 89.45 | 91.66 | |
| GPT-4oTraining Setting=Instruction-tuned baseline2025.03 | 86.29 | 51.8 | 91.9 | |
| GPT-3.5-TurboTraining Setting=Instruction-tuned baseline2025.03 | 79.76 | 39.57 | 86.29 | |
| DeepSeek-v3Training Setting=Instruction-tuned baseline2025.03 | 79.02 | 47.72 | 84.11 | |
| Gemini-2.0-Flash-ExpTraining Setting=Instruction-tuned baseline2025.03 | 75.17 | 47.48 | 79.66 | |
| Qwen2.5-7B-InstructTraining Setting=Instruction-tuned baseline2025.03 | 65.87 | 37.88 | 71.34 | |
| Claude-3.5-SonnetTraining Setting=Instruction-tuned baseline2025.03 | 62.74 | 22.06 | 69.4 | |
| LLaMA-3.1-8B-InstructTraining Setting=Instruction-tuned baseline2025.03 | 13.2 | 2.16 | 15 |