Reward Maximization on Illustrative Setting Novelty-seeking reward maximization
452.5SQ_betaFDC
Evaluation Results
| Method | Links | |
|---|---|---|
| FDCIterations=2, learning rate=3e-6, alpha=10^5, eta=0.625, samples=80002025.11 | 452.5 | |
| Pre-trained2025.11 | 59.6 | |
| AMlearning rate=1e-5, alpha=0.666, gradient steps=10002025.11 | 56.7 | |
| FDCIterations=1, learning rate=3e-6, alpha=10^5, eta=0.625, samples=80002025.11 | 55 |