Proactive Assistant Evaluation on MIT Interview dataset (test)
5.8Response FrequencyLLAMAPIE
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| LLAMAPIEevaluation_protocol=GPT-4o (1-5 scale)2025.05 | 5.8 | 2.03 | 4.34 | 4.77 | 4.92 | 4.8 | 4.92 | 4.88 | 4.83 | 4.22 | 4.94 | 3.68 |
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| LLAMAPIEevaluation_protocol=GPT-4o (1-5 scale)2025.05 | 5.8 | 2.03 | 4.34 | 4.77 | 4.92 | 4.8 | 4.92 | 4.88 | 4.83 | 4.22 | 4.94 | 3.68 |