ResearchBenchmarksSafe Reinforcement Learning on SMARTS T-junction 512K steps (test)Follow21CollisionsCOX-Q14.0461.02108154.98Mar 25, 2026Evaluation ResultsMethodMethodLinksCollisionsOff-road IncidentsRule ViolationsTimeoutsCOX-Qsteps=512K, stochastic...steps=512K, stochastic runs=20002026.0321005TQC-ORACsteps=512K, stochastic...steps=512K, stochastic runs=20002026.03285086CALsteps=512K, stochastic...steps=512K, stochastic runs=20002026.03360017SACLagsteps=512K, stochastic...steps=512K, stochastic runs=20002026.03552240CPPOPIDsteps=512K, stochastic...steps=512K, stochastic runs=20002026.031959130