Reasoning Quality Evaluation on HelpSteer1 sampled (train)
3.89Usefulness ScoreMA-SAPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MA-SAPOConfiguration=Multi-agent reasoning pipeline2025.10 | 3.89 | 3.87 | 4.02 | 3.93 | |
| Single-AgentConfiguration=Single-agent baseline2025.10 | 3.64 | 3.63 | 3.81 | 3.69 |