Multimodal Conversation Generation on VENUS 1.0 (test)
800PPLMARS
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MARSBackbone=Qwen 3B, Evaluation Setting=supervised fine-tuning2025.06 | 800 | 0.839 | 0.123 | 7.295 | 4.666 | |
| MARSBackbone=LLAMA 3B, Evaluation Setting=supervised fine-tuning2025.06 | 926.9 | 0.835 | 0.133 | 8.057 | 5.325 | |
| MARSBackbone=LLAMA 1B, Evaluation Setting=supervised fine-tuning2025.06 | 1,665.8 | 0.834 | 0.13 | 8.676 | 5.33 | |
| MARSBackbone=Qwen 1.5B, Evaluation Setting=supervised fine-tuning2025.06 | 2,990 | 0.839 | 0.115 | 8.812 | 6.144 | |
| Qwen 1.5BBackbone=Qwen 1.5B, Evaluation Setting=zero-shot2025.06 | 3,315.5 | 0.823 | 0.116 | 15.019 | 15.911 | |
| LLAMA 1BBackbone=LLAMA 1B, Evaluation Setting=zero-shot2025.06 | 5,427.1 | 0.811 | 0.11 | 16.232 | 17.039 | |
| LLAMA 3BBackbone=LLAMA 3B, Evaluation Setting=zero-shot2025.06 | 5,477 | 0.818 | 0.136 | 16.504 | 17.574 | |
| Qwen 3BBackbone=Qwen 3B, Evaluation Setting=zero-shot2025.06 | 56,781.1 | 0.811 | 0.131 | 20.85 | 20.874 |