Long-Context Reasoning on LOONG
65.43AccuracyGemini-3.0-pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3.0-pro2026.03 | 65.43 | |
| Deepseek-v3.12026.03 | 50.55 | |
| Deepseek-R1-Distill-Qwen-32B + TableLongOptimization strategy=+ Ours2026.03 | 45.3 | |
| Qwen-Long-L12026.03 | 44.68 | |
| Qwen3-32B + TableLongOptimization strategy=+ Ours2026.03 | 43.1 | |
| Qwen3-32BOptimization strategy=Base2026.03 | 39.96 | |
| Qwen2.5-32B-Instruct + TableLongOptimization strategy=+ Ours2026.03 | 38.18 | |
| Deepseek-R1-Distill-Qwen-32BOptimization strategy=Base2026.03 | 38.17 | |
| Deepseek-R1-Distill-Qwen-14B + TableLongOptimization strategy=+ Ours2026.03 | 35.44 | |
| Qwen2.5-32B-InstructOptimization strategy=Base2026.03 | 33.22 | |
| Deepseek-R1-Distill-Qwen-14BOptimization strategy=Base2026.03 | 25.07 |