Facial Expression Generation on RealTalk
0.0234VariationMMLHG
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| MMLHG2026.03 | 0.0234 | 0.1021 | 3.7914 | 1.2643 | 3.8145 | 6.0427 | |
| Vision-Language-Action (VLA) modelTraining Strategy=Supervised Fine-Tuning (SFT)2026.03 | 0.0371 | 0.0824 | 3.2425 | 0.9142 | 3.8036 | 4.5207 | |
| LM-listener2026.03 | 0.0402 | 0.2416 | 10.8423 | 1.6148 | 10.5483 | 12.273 | |
| Vision-Language-Action (VLA) modelTraining Strategy=SFT + Reinforcement Learning (DPO)2026.03 | 0.0421 | 0.0973 | 3.5842 | 1.2457 | 3.7914 | 4.3531 | |
| GT2026.03 | 0.0478 | — | — | 1.725 | — | — | |
| NN2026.03 | 0.0496 | 0.3147 | 16.0572 | 1.6241 | 15.9657 | 20.1478 | |
| Random2026.03 | 0.0549 | 0.3749 | 17.2541 | 1.9452 | 18.4436 | 24.1739 |