Reinforcement Learning Surrogate Modeling on Pendulum (P) (test)
95Reward RatioCubist
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CubistMNR=30, Model Size=250±12026.07 | 95 | 0.021 | — | |
| Decision TreeMD=10, Model Size=1625±402026.07 | 93 | 0.037 | — | |
| ORCAIDMD=3, Model Size=59±22026.07 | 92 | 0.024 | — | |
| Decision TreeMD=8, Model Size=848±442026.07 | 85 | — | 7 | |
| ORCAIDMD=2, Model Size=19±12026.07 | 84 | — | 15 | |
| CubistMNR=4, Model Size=27±02026.07 | 82 | — | 8 | |
| RuleFitMNR=14, Model Size=61±72026.07 | 78 | — | 13 | |
| RuleFitMNR=10, Model Size=43±42026.07 | 60 | 0.104 | — |