Analysis Report Quality Evaluation on TraceBench Deep Research
91.3Overall ScoreTraceSIR
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| TraceSIRBackbone=Claude-4.6, Evaluation Protocol=LLM-as-a-judge2026.02 | 91.3 | 9.3 | 9 | 9.3 | 9 | 9 | 1 | |
| ClaudeCodeBackbone=Claude-4.6, Evaluation Protocol=LLM-as-a-judge2026.02 | 90 | 9.3 | 8.7 | 9 | 9 | 9 | 2 | |
| TraceSIRBackbone=GLM-5, Evaluation Protocol=LLM-as-a-judge2026.02 | 88 | 9 | 8 | 9 | 9 | 9 | 3 | |
| ClaudeCodeBackbone=GLM-5, Evaluation Protocol=LLM-as-a-judge2026.02 | 82.7 | 8.7 | 8 | 7.3 | 9 | 8.3 | 4 |