Mass Prediction on image2mass (test)
0.519ALDEPhysically Guided Visual Mass Estimation (gated fusion)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Physically Guided Visual Mass Estimation (gated fusion)Input modality=RGB+Depth, Fusion strategy=gated fusion2026.01 | 0.519 | 0.665 | 0.647 | 0.722 | |
| Physically Guided Visual Mass Estimation (concat.)Input modality=RGB+Depth, Fusion strategy=concat.2026.01 | 0.528 | 0.681 | 0.639 | 0.717 | |
| Physically Guided Visual Mass Estimation (self-attn.)Input modality=RGB+Depth, Fusion strategy=self-attn.2026.01 | 0.56 | 0.722 | 0.627 | 0.694 | |
| Cardoso and MorenoInput modality=RGB+Depth, Fusion=Fully connected layers2026.01 | 0.567 | 4.886 | 0.615 | 0.686 | |
| image2massInput modality=RGB-based, Backbone=Xception2026.01 | 0.655 | 1.066 | 0.579 | 0.614 | |
| RGB baselineInput modality=RGB-based, Backbone=ResNet-502026.01 | 0.843 | 1.459 | 0.517 | 0.514 | |
| Qwen-VLInput modality=VLM-based, Prompting strategy=reasoning, Evaluation protocol=zero-shot2026.01 | 1.074 | 39.55 | 0.496 | 0.478 | |
| LLaVAInput modality=VLM-based, Prompting strategy=reasoning, Evaluation protocol=zero-shot2026.01 | 1.833 | 54.008 | 0.361 | 0.325 | |
| LLaVAInput modality=VLM-based, Prompting strategy=direct, Evaluation protocol=zero-shot2026.01 | 1.944 | 63.167 | 0.302 | 0.245 | |
| Qwen-VLInput modality=VLM-based, Prompting strategy=direct, Evaluation protocol=zero-shot2026.01 | 2.133 | 46.618 | 0.402 | 0.398 |