Synthetic Long-context Reasoning on GraphWalks
68.91AccuracyQwen3-30B-A3B-Thinking-2507 + DocQA-RL-1.6K
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-30B-A3B-Thinking-2507 + DocQA-RL-1.6KBase Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=DocQA-RL-1.6K2026.06 | 68.91 | |
| Qwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RLBase Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=Data Recipe for Long-Context RL2026.06 | 67.75 | |
| Qwen3-30B-A3B-Thinking-2507Base Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=Base2026.06 | 66 | |
| Qwen3-30B-A3B-Thinking-2507 + KeyChain-15KBase Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=KeyChain-15K2026.06 | 65.82 | |
| Qwen3-4B-Thinking-2507 + Data Recipe for Long-Context RLBase Model=Qwen3-4B-Thinking-2507, Training Recipe=Data Recipe for Long-Context RL2026.06 | 49.74 | |
| Qwen3-4B-Thinking-2507 + DocQA-RL-1.6KBase Model=Qwen3-4B-Thinking-2507, Training Recipe=DocQA-RL-1.6K2026.06 | 49.42 | |
| Qwen3-4B-Thinking-2507 + KeyChain-15KBase Model=Qwen3-4B-Thinking-2507, Training Recipe=KeyChain-15K2026.06 | 48.7 | |
| Qwen3-4B-Thinking-2507Base Model=Qwen3-4B-Thinking-2507, Training Recipe=Base2026.06 | 48.67 | |
| Qwen3-8B-128KBase Model=Qwen3-8B-128K, Training Recipe=Base2026.06 | 42.27 | |
| Qwen3-8B-128K + KeyChain-15KBase Model=Qwen3-8B-128K, Training Recipe=KeyChain-15K2026.06 | 41.36 | |
| Qwen3-8B-128K + Data Recipe for Long-Context RLBase Model=Qwen3-8B-128K, Training Recipe=Data Recipe for Long-Context RL2026.06 | 40.96 | |
| Qwen3-8B-128K + DocQA-RL-1.6KBase Model=Qwen3-8B-128K, Training Recipe=DocQA-RL-1.6K2026.06 | 39.29 |