Reinforcement Learning Surrogate Modeling on InvertedDoublePendulum (IDP) (test)
103Reward Ratio (%)ORCAID
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ORCAIDMD=3, Model Size=146±42026.07 | 103 | 0.012 | |
| CubistMNR=120, Model Size=1595±62026.07 | 69 | 0.012 | |
| RuleFitMNR=27, Model Size=94±122026.07 | 7 | 0.043 | |
| Decision TreeMD=16, Model Size=4147±882026.07 | 5 | 0.042 |