Voice Interaction Evaluation on TPI-Bench (test)
0.83RSFTPI-Full
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TPI-FullData C (Trained on corpus data)=Yes, Data VA (Trained on dyadic voice assistant data)=Yes, Data HN (Trained on hard negatives)=Yes2026.04 | 0.83 | 4.16 | |
| TPI-BaseData C (Trained on corpus data)=Yes, Data VA (Trained on dyadic voice assistant data)=No, Data HN (Trained on hard negatives)=No2026.04 | 0.82 | 4.32 | |
| TPI-VAData C (Trained on corpus data)=Yes, Data VA (Trained on dyadic voice assistant data)=Yes, Data HN (Trained on hard negatives)=No2026.04 | 0.82 | 4.29 | |
| Qwen2.5-Omni-7BData C (Trained on corpus data)=No, Data VA (Trained on dyadic voice assistant data)=No, Data HN (Trained on hard negatives)=No2026.04 | 0.24 | 3.22 | |
| Kimi-Audio-Instruct-7BData C (Trained on corpus data)=No, Data VA (Trained on dyadic voice assistant data)=No, Data HN (Trained on hard negatives)=No2026.04 | 0.22 | 3.29 | |
| ChatGPT-4o-audioData C (Trained on corpus data)=No, Data VA (Trained on dyadic voice assistant data)=No, Data HN (Trained on hard negatives)=No2026.04 | 0.21 | 4.06 | |
| VITA-Audio-Instruct-7BData C (Trained on corpus data)=No, Data VA (Trained on dyadic voice assistant data)=No, Data HN (Trained on hard negatives)=No2026.04 | 0.21 | 3.26 | |
| Qwen3-Omni-30B-A3B-InstructData C (Trained on corpus data)=No, Data VA (Trained on dyadic voice assistant data)=No, Data HN (Trained on hard negatives)=No2026.04 | 0.19 | 3.55 |