Reinforcement Learning on Seaquest simplified environment
983Average Episodic ReturnBlendRL+Expert
Evaluation Results
| Method | Links | |
|---|---|---|
| BlendRL+ExpertValuation source=expert-written2026.04 | 983 | |
| GRAIL (Claude)Valuation source=Claude, Concept-alignment coefficient (cCA)=0.12026.04 | 981 | |
| BlendRL (no CA)Concept Alignment (CA)=false, Concept-alignment coefficient (cCA)=02026.04 | 953 | |
| GRAIL (GPT-4o)Valuation source=GPT-4o, Concept-alignment coefficient (cCA)=0.32026.04 | 874 | |
| BlendRL+GPT-4oValuation source=GPT-4o2026.04 | 783 | |
| BlendRL+ClaudeValuation source=Claude2026.04 | 559 | |
| NeuralPPO2026.04 | 453 |