Long-context reasoning on LongSeal
64.96AccuracyGEMINI 3.1 FLASH-LITE
Evaluation Results
| Method | Links | |
|---|---|---|
| GEMINI 3.1 FLASH-LITE2026.04 | 64.96 | |
| GPT-OSS-20BReasoning Effort=High, Training Status=SFT (π²-20B-A3B)2026.04 | 64 | |
| GEMINI-2.5-PRO2026.04 | 59.84 | |
| QWEN3.5-35B-A3B-FP8Precision=FP82026.04 | 58.5 | |
| GPT-OSS-20BReasoning Effort=High, Training Status=base2026.04 | 52.17 | |
| GPT-OSS-120B2026.04 | 42.18 | |
| QWEN3-4B-INSTRUCT-2507Training Status=SFT (π²-4B)2026.04 | 40.94 | |
| GPT-OSS-20BReasoning Effort=Low, Training Status=SFT (π²-20B-A3B)2026.04 | 38.19 | |
| GPT-OSS-20BReasoning Effort=Low, Training Status=base2026.04 | 34.65 | |
| QWEN3-4B-INSTRUCT-2507Training Status=base2026.04 | 33.07 |