Dialogue State Tracking on MultiWOZ 2.1
61.29Joint Goal AccuracyReacTOD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ReacTODModel=Claude-Opus-4.6, impractical for production latency=true2026.05 | 61.29 | — | 78.34 | |
| Dai et al. (2021)Extra Pre-training=false2022.01 | 60.61 | — | — | |
| Yu et al. (2021)Extra Pre-training=true2022.01 | 60.48 | — | — | |
| DKF-DST2026.03 | 58.2 | — | — | |
| D3STModel size=XXL2026.03 | 57.8 | — | — | |
| T5-base (independent output)Backbone=T5-base, Output Scheme=Independent2022.01 | 56.66 | — | — | |
| Seq2Seq-DUBackbone=BERT-Base, Uncased2020.11 | 56.1 | 0.911 | — | |
| SimpleTODTraining Setting=standard2021.01 | 55.7 | — | — | |
| Hosseini-Asl et al., 20202022.05 | 55.7 | — | — | |
| SimpleTOD2022.05 | 55.7 | — | — | |
| T5-3BBackbone=T5-3B2022.01 | 55.42 | — | — | |
| Transformer-DST2026.03 | 55.4 | — | — | |
| TripPy2020.11 | 55.3 | — | — | |
| TripPy2026.03 | 55.3 | — | — | |
| T5-baseBackbone=T5-base2022.01 | 54.64 | — | — | |
| SAVN2026.03 | 54.5 | — | — | |
| D3STModel size=Large2026.03 | 54.5 | — | — | |
| T5-largeBackbone=T5-large2022.01 | 54.45 | — | — | |
| DEEPSTRUCTmode=w/ finetune2022.05 | 54.2 | — | — | |
| DEEPSTRUCTTraining strategy=w/ finetune2022.05 | 54.2 | — | — | |
| D3STModel size=Base2026.03 | 54.2 | — | — | |
| DEEPSTRUCTmode=multi-task2022.05 | 53.5 | — | — | |
| DEEPSTRUCTTraining strategy=multi-task2022.05 | 53.5 | — | — | |
| Seq2seq2026.03 | 52.8 | — | — | |
| ReacTODModel=gpt-oss-20B2026.05 | 52.71 | — | 71.77 | |
| ReacTODModel=Qwen3-32B2026.05 | 51.53 | — | 71.83 | |
| SimpleTOD2020.11 | 51.4 | — | — | |
| TANLTraining Setting=multi-task2021.01 | 51.4 | — | — | |
| TANL2022.05 | 51.4 | — | — | |
| TANL (multitask)2022.05 | 51.4 | — | — | |
| FastSGT2020.11 | 51.2 | — | — | |
| SOM-DST2026.03 | 51.2 | — | — | |
| TANLTraining Setting=standard2021.01 | 50.5 | — | — | |
| TANL2022.05 | 50.5 | — | — | |
| SimpleTOD2026.03 | 50.3 | — | — | |
| ReacTODModel=Qwen3-8B2026.05 | 47.34 | — | 68.11 | |
| DS-DST2020.11 | 46 | — | — | |
| TRADETraining Setting=standard2021.01 | 45.6 | — | — | |
| TRADE2022.05 | 45.6 | — | — | |
| DistDSTModel=Llama-3.1-8B, fine-tuned=true2026.05 | 45.2 | — | — | |
| ReacTODModel=Gemma3-12B2026.05 | 45.11 | — | 66.35 | |
| TRADE2020.11 | 43.4 | — | — | |
| FnCTODModel=Qwen3-32B, 5-shot prompts=true2026.05 | 40.36 | — | 63.1 | |
| FnCTODModel=GPT-42026.05 | 38.71 | — | 62.59 | |
| FnCTODModel=Llama2-13B, fine-tuned=true2026.05 | 37.67 | — | 59.54 | |
| FnCTODModel=gpt-oss-20B, 5-shot prompts=true2026.05 | 34.03 | — | 58.56 | |
| SERI-DSTModel=GPT-3.52026.05 | — | — | 60.58 |