Multi-turn conversational agent interaction on UserBench (test)
46.53Score (T-22)Asym-AC-SFT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Asym-AC-SFTActor=Claude-4 Sonnet, Critic=Qwen3-8B, Fine-tuning=Supervised fine-tuning of the critic2026.03 | 46.53 | 41.61 | 37.13 | 41.76 | |
| Asym-ACActor=Claude-4 Sonnet, Critic=Off-the-shelf, Fine-tuning=None2026.03 | 43.56 | 35.66 | 34.72 | 37.98 | |
| CRITICActor=Claude-4 Sonnet, Mode=Single-actor self-critique using in-context critique demonstrations2026.03 | 43.32 | 34.55 | 30.69 | 36.19 |