Text-to-3D Generation on Objaverse 1.0 (test)
81.6CLIP ScoreGround Truth Images
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Ground Truth Imagesstate=Reference2023.06 | 81.6 | — | 32.7 | 55.1 | 64.3 | |
| Shap-E (STF)training_state=Pretrained2023.06 | 80.4 | 37.2 | 20.3 | 39.7 | 48.7 | |
| Shap-E (NeRF)training_state=Pretrained2023.06 | 79.4 | 48.7 | 19 | 37.7 | 46.8 | |
| Shap-E (STF)training_state=Finetuned on Cap3D2023.06 | 79.1 | 35.5 | 20 | 38.8 | 47.3 | |
| Shap-E (NeRF)training_state=Finetuned on Cap3D2023.06 | 78.1 | 48.2 | 18.3 | 35.1 | 43.5 | |
| Point-E (Text-to-3D)training_state=Finetuned on Cap3D2023.06 | 75.6 | 32.8 | 12.4 | 28.1 | 36.9 | |
| S. Diff. (CNet) + Point-E (Im-to-3D)training_state=Finetuned on Cap3D2023.06 | 74.6 | 53.3 | 12.4 | 26.2 | 33.8 | |
| S. Diff. (LoRA) + Point-E (Im-to-3D)training_state=Finetuned on Cap3D2023.06 | 74.4 | 53.7 | 11.6 | 24.6 | 31.4 | |
| S. Diff. (CNet) + Point-E (Im-to-3D)training_state=Pretrained2023.06 | 73.6 | 54.7 | 11 | 23.4 | 30 | |
| S. Diff. (LoRA) + Point-E (Im-to-3D)training_state=Pretrained2023.06 | 73.6 | 54.7 | 11 | 23.4 | 30 | |
| Point-E (Text-to-3D)training_state=Pretrained2023.06 | 72.4 | 36.1 | 6 | 16.2 | 22.4 |