Long-context QA on LongBench Long v2
41.7AccuracyQwen3-Coder-30B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-Coder-30BTraining Source=Off-the-shelf reference models2026.06 | 41.7 | |
| Qwen3-32BTraining Source=Off-the-shelf reference models2026.06 | 31.5 | |
| CONTEXTRLTraining Source=Qwen3-8B, Training Strategy=CONTEXTRL2026.06 | 29.6 | |
| CONTEXTRLTraining Source=Klear-AgentForge-8B, Training Strategy=CONTEXTRL2026.06 | 28.7 | |
| Base modelTraining Source=Qwen3-8B, Training Strategy=Base model2026.06 | 27.8 | |
| RL baselineTraining Source=Qwen3-8B, Training Strategy=RL baseline2026.06 | 26.9 | |
| Qwen3-14BTraining Source=Off-the-shelf reference models2026.06 | 24.1 | |
| RL baselineTraining Source=Klear-AgentForge-8B, Training Strategy=RL baseline2026.06 | 24.1 | |
| Base modelTraining Source=Klear-AgentForge-8B, Training Strategy=Base model2026.06 | 21.3 |