Long-context reasoning on OfficeQA
57.14AccuracyGEMINI 3.1 FLASH-LITE
Evaluation Results
| Method | Links | |
|---|---|---|
| GEMINI 3.1 FLASH-LITE2026.04 | 57.14 | |
| QWEN3.5-35B-A3B-FP8Precision=FP82026.04 | 55.74 | |
| GEMINI-2.5-PRO2026.04 | 53.37 | |
| GPT-OSS-20BReasoning Effort=High, Training Status=SFT (π²-20B-A3B)2026.04 | 46.58 | |
| GPT-OSS-20BReasoning Effort=High, Training Status=base2026.04 | 37.84 | |
| GPT-OSS-120B2026.04 | 33.88 | |
| GPT-OSS-20BReasoning Effort=Low, Training Status=SFT (π²-20B-A3B)2026.04 | 26.53 | |
| GPT-OSS-20BReasoning Effort=Low, Training Status=base2026.04 | 21.63 | |
| QWEN3-4B-INSTRUCT-2507Training Status=base2026.04 | 14.88 | |
| QWEN3-4B-INSTRUCT-2507Training Status=SFT (π²-4B)2026.04 | 13.58 |