Discriminative Sensitivity on micro-perturbed pair dataset
38.2Win Rateretrieval-augmented multi-agent framework
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| retrieval-augmented multi-agent frameworkRubric=Ours2026.01 | 38.2 | 61.8 | 8.658 | 0.977 | |
| GPT-4o RubricRubric=GPT-4o2026.01 | 30.4 | 68.6 | 4.972 | 0.975 | |
| Generic RubricRubric=Generic2026.01 | 27.8 | 70.4 | 1.878 | 0.92 | |
| No RubricRubric=None2026.01 | 18.5 | 78.7 | 0.832 | 0.794 |