Reinforcement Learning on FrozenLake
0.94RewardERL
Evaluation Results
| Method | Links | |
|---|---|---|
| ERLBackbone=Qwen3-4B-Instruct-2507, Method variant=Full2026.02 | 0.94 | |
| RLVRBackbone=Qwen3-4B-Instruct-25072026.02 | 0.86 | |
| ERL w/o Mem.Backbone=Qwen3-4B-Instruct-2507, Method variant=Without memory reuse2026.02 | 0.86 | |
| ERLBackbone=Olmo3-7B-Instruct, Method variant=Full2026.02 | 0.66 | |
| ERL w/o Mem.Backbone=Olmo3-7B-Instruct, Method variant=Without memory reuse2026.02 | 0.64 | |
| R2PONumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 0.62 | |
| ERL w/o Refl.Backbone=Qwen3-4B-Instruct-2507, Method variant=Without structured reflection2026.02 | 0.6 | |
| ERL w/o Refl.Backbone=Olmo3-7B-Instruct, Method variant=Without structured reflection2026.02 | 0.54 | |
| RLVRBackbone=Olmo3-7B-Instruct2026.02 | 0.39 | |
| ProPS+Number of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 0.37 | |
| ProPSNumber of runs=10, Aggregation protocol=averaged across all training iterations2026.05 | 0.05 | |
| TRPONumber of runs=10, Aggregation protocol=averaged across all training iterations, Source=Best SB32026.05 | 0.02 |