Offline Reinforcement Learning for Dialogue Management on Reddit Casual
4.65ReturnSAIQL
Evaluation Results
| Method | Links | |
|---|---|---|
| SAIQLEvaluation Approach=Model Based2023.02 | 4.65 | |
| FtLEEvaluation Approach=Model Based2023.02 | 4.59 | |
| MoE-VRLEvaluation Approach=Model Based2023.02 | 4.46 | |
| EXP 1*Evaluation Approach=Model Based2023.02 | 4.25 | |
| FtLEEvaluation Approach=Model Free2023.02 | 1.14 | |
| EXP 1*Evaluation Approach=Model Free2023.02 | 0.97 | |
| SAIQLEvaluation Approach=Model Free2023.02 | 0.81 | |
| MoE-VRLEvaluation Approach=Model Free2023.02 | 0.72 |