Synthetic Long-context Reasoning on LongReason
84.89AccuracyQwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RLBase Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=Data Recipe for Long-Context RL2026.06 | 84.89 | |
| Qwen3-30B-A3B-Thinking-2507 + KeyChain-15KBase Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=KeyChain-15K2026.06 | 84.76 | |
| Qwen3-4B-Thinking-2507 + Data Recipe for Long-Context RLBase Model=Qwen3-4B-Thinking-2507, Training Recipe=Data Recipe for Long-Context RL2026.06 | 82.12 | |
| Qwen3-30B-A3B-Thinking-2507Base Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=Base2026.06 | 81.61 | |
| Qwen3-30B-A3B-Thinking-2507 + DocQA-RL-1.6KBase Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=DocQA-RL-1.6K2026.06 | 80.86 | |
| Qwen3-4B-Thinking-2507 + KeyChain-15KBase Model=Qwen3-4B-Thinking-2507, Training Recipe=KeyChain-15K2026.06 | 76.2 | |
| Qwen3-8B-128K + Data Recipe for Long-Context RLBase Model=Qwen3-8B-128K, Training Recipe=Data Recipe for Long-Context RL2026.06 | 73.93 | |
| Qwen3-8B-128K + KeyChain-15KBase Model=Qwen3-8B-128K, Training Recipe=KeyChain-15K2026.06 | 72.04 | |
| Qwen3-4B-Thinking-2507 + DocQA-RL-1.6KBase Model=Qwen3-4B-Thinking-2507, Training Recipe=DocQA-RL-1.6K2026.06 | 71.28 | |
| Qwen3-4B-Thinking-2507Base Model=Qwen3-4B-Thinking-2507, Training Recipe=Base2026.06 | 69.5 | |
| Qwen3-8B-128KBase Model=Qwen3-8B-128K, Training Recipe=Base2026.06 | 68.26 | |
| Qwen3-8B-128K + DocQA-RL-1.6KBase Model=Qwen3-8B-128K, Training Recipe=DocQA-RL-1.6K2026.06 | 67.88 |