Long-context QA on LongBench Overall v2
42.5AccuracyQwen3-Coder-30B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-Coder-30BTraining Source=Off-the-shelf reference models2026.06 | 42.5 | |
| Qwen3-32BTraining Source=Off-the-shelf reference models2026.06 | 36.8 | |
| Qwen3-14BTraining Source=Off-the-shelf reference models2026.06 | 34.2 | |
| CONTEXTRLTraining Source=Qwen3-8B, Training Strategy=CONTEXTRL2026.06 | 33.2 | |
| RL baselineTraining Source=Qwen3-8B, Training Strategy=RL baseline2026.06 | 31.8 | |
| Base modelTraining Source=Qwen3-8B, Training Strategy=Base model2026.06 | 31.6 | |
| CONTEXTRLTraining Source=Klear-AgentForge-8B, Training Strategy=CONTEXTRL2026.06 | 29.6 | |
| Base modelTraining Source=Klear-AgentForge-8B, Training Strategy=Base model2026.06 | 27.4 | |
| RL baselineTraining Source=Klear-AgentForge-8B, Training Strategy=RL baseline2026.06 | 27 |