Holistic Long-context Reasoning on DocFinQA
51.63AccuracyQwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RLBase Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=Data Recipe for Long-Context RL2026.06 | 51.63 | |
| Qwen3-30B-A3B-Thinking-2507 + DocQA-RL-1.6KBase Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=DocQA-RL-1.6K2026.06 | 51.41 | |
| Qwen3-30B-A3B-Thinking-2507 + KeyChain-15KBase Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=KeyChain-15K2026.06 | 50 | |
| Qwen3-4B-Thinking-2507 + Data Recipe for Long-Context RLBase Model=Qwen3-4B-Thinking-2507, Training Recipe=Data Recipe for Long-Context RL2026.06 | 48.37 | |
| Qwen3-4B-Thinking-2507 + DocQA-RL-1.6KBase Model=Qwen3-4B-Thinking-2507, Training Recipe=DocQA-RL-1.6K2026.06 | 48.05 | |
| Qwen3-4B-Thinking-2507 + KeyChain-15KBase Model=Qwen3-4B-Thinking-2507, Training Recipe=KeyChain-15K2026.06 | 47.29 | |
| Qwen3-30B-A3B-Thinking-2507Base Model=Qwen3-30B-A3B-Thinking-2507, Training Recipe=Base2026.06 | 41.11 | |
| Qwen3-4B-Thinking-2507Base Model=Qwen3-4B-Thinking-2507, Training Recipe=Base2026.06 | 39.8 | |
| Qwen3-8B-128K + Data Recipe for Long-Context RLBase Model=Qwen3-8B-128K, Training Recipe=Data Recipe for Long-Context RL2026.06 | 39.59 | |
| Qwen3-8B-128KBase Model=Qwen3-8B-128K, Training Recipe=Base2026.06 | 38.83 | |
| Qwen3-8B-128K + DocQA-RL-1.6KBase Model=Qwen3-8B-128K, Training Recipe=DocQA-RL-1.6K2026.06 | 37.96 | |
| Qwen3-8B-128K + KeyChain-15KBase Model=Qwen3-8B-128K, Training Recipe=KeyChain-15K2026.06 | 35.79 |