Reinforcement Learning on MiniHack Corridor-5
1Mean ReturnPPO-RNN
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PPO-RNNArchitecture=RNN, Masking Condition=C2: Unmasked, Evaluation Protocol=GT2026.03 | 1 | 0.29 | 52 | |
| PPO-RNNArchitecture=RNN, Masking Condition=C2: Unmasked, Evaluation Protocol=Pred2026.03 | 1 | 0.29 | 52 | |
| PPO-RNNArchitecture=RNN, Masking Condition=C1: Masked, Evaluation Protocol=GT2026.03 | 1 | 0.16 | 52.1 | |
| PPO-RNNArchitecture=RNN, Masking Condition=C3: Masked + Focal, Evaluation Protocol=GT2026.03 | 1 | 0.21 | 52 | |
| PPO-RNNArchitecture=RNN, Masking Condition=C3: Masked + Focal, Evaluation Protocol=Pred2026.03 | 1 | 0.21 | 52 | |
| PPO-RNNArchitecture=RNN, Masking Condition=C4: Masked + KL, Evaluation Protocol=GT2026.03 | 1 | 0.21 | 53.8 | |
| PPO-RNNArchitecture=RNN, Masking Condition=C4: Masked + KL, Evaluation Protocol=Pred2026.03 | 1 | 0.21 | 53.8 | |
| PPO-HybridArchitecture=Hybrid, Masking Condition=C2: Unmasked, Evaluation Protocol=GT2026.03 | 1 | 0.84 | 94.6 | |
| PPO-HybridArchitecture=Hybrid, Masking Condition=C2: Unmasked, Evaluation Protocol=Pred2026.03 | 1 | 0.84 | 94.6 | |
| PPO-HybridArchitecture=Hybrid, Masking Condition=C1: Masked, Evaluation Protocol=GT2026.03 | 1 | 0.63 | 80.7 | |
| PPO-HybridArchitecture=Hybrid, Masking Condition=C3: Masked + Focal, Evaluation Protocol=GT2026.03 | 1 | 0.76 | 92 | |
| PPO-HybridArchitecture=Hybrid, Masking Condition=C3: Masked + Focal, Evaluation Protocol=Pred2026.03 | 1 | 0.76 | 92 | |
| PPO-HybridArchitecture=Hybrid, Masking Condition=C4: Masked + KL, Evaluation Protocol=GT2026.03 | 1 | 0.65 | 88 | |
| PPO-HybridArchitecture=Hybrid, Masking Condition=C4: Masked + KL, Evaluation Protocol=Pred2026.03 | 1 | 0.65 | 88 | |
| PPO-MLPArchitecture=MLP, Masking Condition=C2: Unmasked, Evaluation Protocol=GT2026.03 | 0.9 | — | 161.3 | |
| PPO-MLPArchitecture=MLP, Masking Condition=C2: Unmasked, Evaluation Protocol=Pred2026.03 | 0.9 | — | 161.3 | |
| PPO-MLPArchitecture=MLP, Masking Condition=C1: Masked, Evaluation Protocol=GT2026.03 | 0.9 | — | 118.3 | |
| PPO-MLPArchitecture=MLP, Masking Condition=C3: Masked + Focal, Evaluation Protocol=GT2026.03 | 0.9 | — | 113.6 | |
| PPO-MLPArchitecture=MLP, Masking Condition=C3: Masked + Focal, Evaluation Protocol=Pred2026.03 | 0.9 | — | 113.6 | |
| PPO-MLPArchitecture=MLP, Masking Condition=C4: Masked + KL, Evaluation Protocol=GT2026.03 | 0.9 | — | 123.6 | |
| PPO-MLPArchitecture=MLP, Masking Condition=C4: Masked + KL, Evaluation Protocol=Pred2026.03 | 0.9 | — | 123.6 | |
| PPO-HybridArchitecture=Hybrid, Masking Condition=C1: Masked, Evaluation Protocol=Pred2026.03 | 0.3 | 0.63 | 80.7 | |
| PPO-RNNArchitecture=RNN, Masking Condition=C1: Masked, Evaluation Protocol=Pred2026.03 | 0.2 | 0.16 | 52.1 | |
| PPO-MLPArchitecture=MLP, Masking Condition=C1: Masked, Evaluation Protocol=Pred2026.03 | 0.1 | — | 118.3 |