Offline Reinforcement Learning on Ising Model N=1000 (Medium-Replay)
82.4Normalized ReturnMF-Diffuser
Evaluation Results
| Method | Links | |
|---|---|---|
| MF-DiffuserN=1000, Seeds=5, Online rollouts=102026.05 | 82.4 | |
| MFQ-OfflineN=1000, Seeds=5, Online rollouts=102026.05 | 81 | |
| MF-CDMs-RLN=1000, Seeds=5, Online rollouts=102026.05 | 80.3 | |
| OryxN=1000, Seeds=5, Online rollouts=102026.05 | 77.8 | |
| DoFN=1000, Seeds=5, Online rollouts=102026.05 | 73.5 | |
| Indep. DiffuserN=1000, Seeds=5, Online rollouts=102026.05 | 69.8 | |
| MADiffN=1000, Seeds=5, Online rollouts=102026.05 | 58.9 | |
| Joint DiffuserN=1000, Seeds=5, Online rollouts=102026.05 | 53.2 | |
| OMARN=1000, Seeds=5, Online rollouts=10, mean-field adaptation=true2026.05 | 47.6 | |
| MA-TD3+BCN=1000, Seeds=5, Online rollouts=10, mean-field adaptation=true2026.05 | 46.5 |