Safe Reinforcement Learning on Camera Dropbox
0Reward Hacking RateOracle MONA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Oracle MONASource=public ref.2026.03 | 0 | 99.9 | 0.1 | — | |
| Best LearnedSource=local pilot, Horizon (h)=1, Calibration type=sigmoid, Dataset size=512, PPO steps budget=15362026.03 | 0 | 11.9 | — | 0.363 | |
| Ordinary RLSource=public ref.2026.03 | 91.5 | 7.7 | 0.7 | — |