Adaptive Policy Retrieval on Prior Authorization
0.084WISBC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BC2026.04 | 0.084 | 2.41 | |
| Conservative Q-Learning (CQL)2026.04 | 0.055 | 2.22 | |
| Implicit Q-Learning (IQL)2026.04 | 0.021 | 0.17 | |
| Direct Preference Optimization (DPO)2026.04 | 0.012 | 0.34 |