Bilevel Reinforcement Learning on LL Problem: Max
1Iteration ComplexityPARL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PARLDeter. or Stoc.=Deter., Oracle=1st + 2nd2026.05 | 1 | — | |
| First-Order BRLDeter. or Stoc.=Stoc., Oracle=1st2026.05 | 1 | 3 | |
| PBRLDeter. or Stoc.=Deter., Oracle=1st2026.05 | 1.5 | — | |
| SoBiRLDeter. or Stoc.=Stoc., Oracle=1st2026.05 | 1.5 | 3.5 | |
| HPGDDeter. or Stoc.=Stoc., Oracle=1st2026.05 | 2 | — | |
| SLACDeter. or Stoc.=Stoc., Oracle=1st2026.05 | 3 | 3 |