Long-context reasoning on OOLONG
68.4Accuracyλ-RLM
Evaluation Results
| Method | Links | |
|---|---|---|
| λ-RLMParadigm=P3, Model Family=Qwen3, Model Scale=235B2026.03 | 68.4 | |
| RLMParadigm=P2, Model Family=Llama, Model Scale=405B2026.03 | 63.8 | |
| λ-RLMParadigm=P3, Model Family=Qwen3, Model Scale=32B2026.03 | 62.5 | |
| λ-RLMParadigm=P3, Model Family=Llama, Model Scale=405B2026.03 | 61.7 | |
| λ-RLMParadigm=P3, Model Family=Llama, Model Scale=70B2026.03 | 61.2 | |
| RLMParadigm=P2, Model Family=Qwen3, Model Scale=235B2026.03 | 56.5 | |
| λ-RLMParadigm=P3, Model Family=Mistral, Model Scale=8x22B2026.03 | 55.8 | |
| λ-RLMParadigm=P3, Model Family=Qwen3, Model Scale=8B2026.03 | 48.3 | |
| RLMParadigm=P2, Model Family=Mistral, Model Scale=Cdsrl2026.03 | 48.2 | |
| DirectParadigm=P1, Model Family=Llama, Model Scale=405B2026.03 | 47.1 | |
| λ-RLMParadigm=P3, Model Family=Llama, Model Scale=8B2026.03 | 45.7 | |
| λ-RLMParadigm=P3, Model Family=Mistral, Model Scale=Cdsrl2026.03 | 45.6 | |
| RLMParadigm=P2, Model Family=Llama, Model Scale=70B2026.03 | 45.3 | |
| DirectParadigm=P1, Model Family=Qwen3, Model Scale=235B2026.03 | 44 | |
| RLMParadigm=P2, Model Family=Qwen3, Model Scale=32B2026.03 | 42.7 | |
| GEMINI 3.1 FLASH-LITE2026.04 | 42.38 | |
| λ-RLMParadigm=P3, Model Family=Mistral, Model Scale=7B2026.03 | 40.2 | |
| QWEN3.5-35B-A3B-FP8Precision=FP82026.04 | 39.76 | |
| RLMParadigm=P2, Model Family=Mistral, Model Scale=8x22B2026.03 | 38.9 | |
| GPT-OSS-120B2026.04 | 38.08 | |
| GEMINI-2.5-PRO2026.04 | 36.56 | |
| GPT-OSS-20BReasoning Effort=High, Training Status=base2026.04 | 35.86 | |
| QWEN3-4B-INSTRUCT-2507Training Status=SFT (π²-4B)2026.04 | 35.48 | |
| DirectParadigm=P1, Model Family=Llama, Model Scale=70B2026.03 | 34.8 | |
| GPT-OSS-20BReasoning Effort=Low, Training Status=SFT (π²-20B-A3B)2026.04 | 33.31 | |
| GPT-OSS-20BReasoning Effort=High, Training Status=SFT (π²-20B-A3B)2026.04 | 31.95 | |
| DirectParadigm=P1, Model Family=Qwen3, Model Scale=32B2026.03 | 31.2 | |
| GPT-OSS-20BReasoning Effort=Low, Training Status=base2026.04 | 31.03 | |
| QWEN3-4B-INSTRUCT-2507Training Status=base2026.04 | 29.67 | |
| DirectParadigm=P1, Model Family=Mistral, Model Scale=8x22B2026.03 | 28.5 | |
| RLMParadigm=P2, Model Family=Qwen3, Model Scale=8B2026.03 | 24.1 | |
| DirectParadigm=P1, Model Family=Mistral, Model Scale=Cdsrl2026.03 | 22.6 | |
| RLMParadigm=P2, Model Family=Llama, Model Scale=8B2026.03 | 22.6 | |
| RLMParadigm=P2, Model Family=Mistral, Model Scale=7B2026.03 | 18.3 | |
| DirectParadigm=P1, Model Family=Llama, Model Scale=8B2026.03 | 14.3 | |
| DirectParadigm=P1, Model Family=Qwen3, Model Scale=8B2026.03 | 12.5 | |
| DirectParadigm=P1, Model Family=Mistral, Model Scale=7B2026.03 | 10.8 |