Motion Generation on TRUMANS (test)
2.932Diversity (Div)Lingo
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| LingoScene Representation=3D occupancy grid2026.07 | 2.932 | 0.493 | 0.657 | 0.941 | 2.279 | 13.376 | |
| DeSeGScene Representation=3D occupancy grid2026.07 | 2.853 | 0.338 | 0.621 | 0.986 | 1.183 | 9.187 | |
| Ground truthScene Representation=-, Scene Encoder=-, # Trainable Scene Params=-2026.02 | 2.75 | — | 0.24 | — | — | — | |
| TRUMANSScene Representation=Voxelized 3D occupancy grid, Scene Encoder=ViT-B Encoder [7], # Trainable Scene Params=~ 86M2026.02 | 2.71 | 0.34 | 0.58 | 0.98 | 1.83 | 11.75 | |
| SceMoSScene Representation=BEV image + 2D heightmap, Scene Encoder=DINOv2 (frozen) + linear, # Trainable Scene Params=~ 4M2026.02 | 2.67 | 0.31 | 0.61 | 0.98 | 1.81 | 11.12 | |
| A6: CLIP featuresScene Representation=BEV image + 2D heightmap, Scene Encoder=CLIP (frozen) + linear, # Trainable Scene Params=~ 4M2026.02 | 2.41 | 0.81 | 0.87 | 0.91 | 1.99 | 12.89 | |
| Scene DiffuserScene Representation=3D point clouds, Scene Encoder=Point Transformer [66], # Trainable Scene Params=~ 55M2026.02 | 2.03 | 0.75 | 1.09 | 0.91 | 1.71 | 17.49 | |
| TeSMoScene Representation=2D floormap + 3D point clouds, Scene Encoder=ResNet + transformer, # Trainable Scene Params=~ 35M2026.02 | 2.02 | 0.48 | 0.65 | 0.92 | 2.11 | 11.98 | |
| A7: W/o trajectory refinementScene Representation=BEV image + 2D heightmap, Scene Encoder=DINOv2 (frozen) + linear, # Trainable Scene Params=~ 4M2026.02 | 2.01 | 0.53 | 1.93 | 0.79 | 2.78 | 15.56 | |
| HumaniseScene Representation=3D point clouds, Scene Encoder=Point Transformer [66], # Trainable Scene Params=~ 55M2026.02 | 1.95 | 0.82 | 1.21 | 0.96 | 1.95 | 14.37 | |
| A5: Single stage transformerScene Representation=BEV image, Scene Encoder=DINOv2 (frozen) + linear, # Trainable Scene Params=~ 4M2026.02 | 1.45 | 0.78 | 1.67 | 0.61 | 3.19 | 18.99 |