Multi-task reinforcement learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
90.9Overall Success Rate
16
May 13, 2026
99.5Success Rate
15
May 13, 2026
88Success Rate
12
Feb 26, 2026
79.3Success Rate (IQM)
11
May 13, 2026
4.2Time
11
Feb 26, 2026
91Average Success
9
Feb 26, 2026
61.32Avg Success Rate
8
Feb 26, 2026
60Success Rate
8
Feb 26, 2026
72.8Mean Capped Human Score
8
Feb 26, 2026
82Validation Score
6
Mar 19, 2026
78Success Rate
6
Mar 19, 2026
48.94Average Success Rate
6
Feb 26, 2026
61Average Success Rate
6
Feb 26, 2026
71.8Average Success Rate
6
Feb 26, 2026
79IQM
5
Apr 10, 2026
81Success Rate (d=0)
4
Jun 25, 2026
10.83Relative tasks solved ratio (vs DIBS)
4
Jun 2, 2026
81.7Mean-Capped Human-Normalized Score
4
Feb 26, 2026
10,700Median Human Normalised Score
4
Feb 26, 2026
110.7Median Human Normalized Score
4
Feb 26, 2026
14.04Relative Solved Ratio (vs DIBS)
3
Jun 2, 2026
0.735Mean capped human normalised score
2
Feb 26, 2026
—
—Primary metric
0
Feb 26, 2026