Personalized Agentic Social Support on ComPASS-Bench profile-based setting (test)
100Pass RateGPT-5.1
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| GPT-5.1Mode=Instant2026.04 | 100 | 8.65 | 12.23 | 4.15 | 3.8 | 3.39 | 3.54 | 4.08 | 4.76 | |
| ComPASS-QwenMode=Instant2026.04 | 100 | 8.02 | 11.35 | 4.13 | 3.5 | 2.66 | 3.19 | 4.01 | 4.65 | |
| GPT-5.1Mode=Reasoning2026.04 | 100 | 8.41 | 11.89 | 4.08 | 3.77 | 3.43 | 3.48 | 4.03 | 4.71 | |
| Claude-Sonnet-4.5Mode=Instant2026.04 | 99.93 | 7.29 | 10.31 | 3.96 | 3.15 | 2.99 | 3.01 | 3.96 | 4.59 | |
| Qwen3-32BMode=Reasoning2026.04 | 99.93 | 6.74 | 9.54 | 3.13 | 2.74 | 2.84 | 2.68 | 3.34 | 4.15 | |
| Gemini-3-ProMode=Instant2026.04 | 99.87 | 6.76 | 9.56 | 3.77 | 3.01 | 3.2 | 2.87 | 3.83 | 4.52 | |
| Qwen3-MaxMode=Instant2026.04 | 99.87 | 6.77 | 9.58 | 3.7 | 2.96 | 3.1 | 2.81 | 3.81 | 4.47 | |
| Qwen3-8BMode=Instant2026.04 | 99.87 | 5.72 | 8.09 | 2.69 | 2.18 | 2.5 | 2.18 | 3.02 | 3.83 | |
| DeepSeek-V3.2Mode=Instant2026.04 | 99.67 | 6.64 | 9.39 | 3.49 | 2.72 | 2.77 | 2.55 | 3.58 | 4.33 | |
| Qwen3-8BMode=Reasoning2026.04 | 99.07 | 5.91 | 8.36 | 2.95 | 2.47 | 2.74 | 2.43 | 3.16 | 4.04 | |
| Qwen3-32BMode=Instant2026.04 | 95.87 | 6.79 | 9.61 | 3.07 | 2.41 | 2.62 | 2.38 | 3.32 | 4.07 | |
| Llama-3.1-8bMode=Instant2026.04 | 95.87 | 6.04 | 8.55 | 2.47 | 1.94 | 2.03 | 1.95 | 2.66 | 3.49 |