Reasoning over Large Structured Context on Hard
5ReasoningJudge ScoreGPT-5 + HYVE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5 + HYVEOptimization=HYVE pipeline2026.04 | 5 | 20.3 | 16.96 | |
| GPT-4.1 + HYVEOptimization=HYVE pipeline2026.04 | 5 | 15.1 | 5.43 | |
| GPT-5Optimization=Standard JSON serialization2026.04 | 4.33 | 80.5 | 19.45 | |
| GPT-4.1Optimization=Standard JSON serialization2026.04 | 4.04 | 75.1 | 8.07 |