Human Behavior Modeling on CVABench (test)
0.07Media Linguistic TTRQwen2.5-7B-SFT+DPO
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5-7B-SFT+DPOBackbone=Qwen2.5-7B, Training Mode=SFT+DPO2026.04 | 0.07 | 43 | 33 | 0.04 | 52 | 23 | 2.96 | 27.98 | |
| Role-Play AgentBackbone=GPT-4o-mini, Training Mode=Training-free2026.04 | 0.06 | 35 | 36 | 0.07 | 40 | 5 | 2.87 | 10.29 | |
| Reasoning Agent - 0Backbone=GPT-4o-mini, Training Mode=Training-free2026.04 | 0.06 | 36 | 35 | 0.08 | 38 | 4 | 2.89 | 7.06 | |
| Reasoning Agent - 2Backbone=GPT-4o-mini, Training Mode=Training-free2026.04 | 0.06 | 43 | 38 | 0.06 | 31 | 2 | 2.87 | -35.31 | |
| Reasoning Agent - 4Backbone=GPT-4o-mini, Training Mode=Training-free2026.04 | 0.06 | 42 | 38 | 0.06 | 31 | 2 | 2.88 | -40.74 | |
| Qwen2.5-7B SFTBackbone=Qwen2.5-7B, Training Mode=SFT2026.04 | 0.06 | 43 | 33 | 0.04 | 52 | 23 | 3.04 | 18.68 | |
| CVA (Ours)Backbone=Qwen2.5-7B2026.04 | 0.04 | 47 | 36 | 0.03 | 53 | 32 | 2.77 | 1.06 |