End-to-end policy optimization on Sequential cooperative bandit testbed (test)
10.2Mean Normalized Regret AUCCAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| CAPOK=102026.04 | 10.2 | |
| CAPOK=82026.04 | 10.3 | |
| CAPOK=62026.04 | 10.7 | |
| CAPOK=42026.04 | 11.5 | |
| MA-GRPOK=22026.04 | 11.6 | |
| MA-GRPOK=42026.04 | 11.6 | |
| HA-GRPOK=22026.04 | 11.9 | |
| MA-GRPOK=62026.04 | 11.9 | |
| MA-GRPOK=82026.04 | 11.9 | |
| CAPOK=22026.04 | 12.5 | |
| MA-GRPOK=102026.04 | 12.5 | |
| HA-GRPOK=42026.04 | 14.2 | |
| HA-GRPOK=62026.04 | 17.9 | |
| HA-GRPOK=82026.04 | 21.8 | |
| C3K=22026.04 | 24.4 | |
| HA-GRPOK=102026.04 | 25.3 | |
| C3K=42026.04 | 25.5 | |
| C3K=62026.04 | 26.3 | |
| C3K=82026.04 | 26.7 | |
| C3K=102026.04 | 27.3 |