Reinforcement Learning on Kangaroo simplified environment
3,683Average Episodic ReturnBlendRL+Expert
Evaluation Results
| Method | Links | |
|---|---|---|
| BlendRL+ExpertValuation source=expert-written2026.04 | 3,683 | |
| GRAIL (Claude)Valuation source=Claude, Concept-alignment coefficient (cCA)=0.32026.04 | 3,625 | |
| GRAIL (GPT-4o)Valuation source=GPT-4o, Concept-alignment coefficient (cCA)=0.32026.04 | 3,540 | |
| BlendRL (no CA)Concept Alignment (CA)=false, Concept-alignment coefficient (cCA)=02026.04 | 1,280 | |
| BlendRL+GPT-4oValuation source=GPT-4o2026.04 | 1,112 | |
| NeuralPPO2026.04 | 1,045 | |
| BlendRL+ClaudeValuation source=Claude2026.04 | 910 |