Open-ended Task Evaluation on MT-Bench (Writing, Roleplay, Humanities subset)
71.7Writing ScoreUPA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| UPAExecutor=DeepSeek-V3.2, Baseline Comparison=IO2026.01 | 71.7 | 70 | 75 | 72.2 | |
| UPAExecutor=Claude-4.5-Sonnet, Baseline Comparison=IO2026.01 | 60 | 62.5 | 85 | 69.2 | |
| UPAExecutor=GPT-5, Baseline Comparison=IO2026.01 | 55 | 62.5 | 68.3 | 61.9 | |
| UPAExecutor=Claude-4.5-Sonnet, Baseline Comparison=SPO2026.01 | 53.3 | 50.8 | 58.3 | 54.1 | |
| UPAExecutor=DeepSeek-V3.2, Baseline Comparison=SPO2026.01 | 53.3 | 55.8 | 70 | 59.7 | |
| UPAExecutor=GPT-5, Baseline Comparison=SPO2026.01 | 50.8 | 66.7 | 57.5 | 58.3 |