Long-context Retrieval and Reasoning on NeedleBench (Context Scaling)
91.9Accuracy @ 8k ContextQwen2-72B-Instruct
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen2-72B-InstructYARN+DCA=false2024.07 | 91.9 | 92.01 | 73.05 | 17.13 | |
| Qwen2-72B-InstructYARN+DCA=true2024.07 | 91.9 | 92.01 | 90.27 | 85.21 | |
| Qwen2-7B-InstructYARN+DCA=false2024.07 | 87.07 | 73.64 | 38.77 | 2.92 | |
| Qwen2-7B-InstructYARN+DCA=true2024.07 | 87.07 | 73.64 | 66.32 | 60.71 | |
| ChatGLM4-9B-1M2024.07 | 56.61 | 49.15 | 44.3 | 45.29 |