CS research tasks on CoT 200-prompt (held-out test)
77.4Mean@3Qwen3.5-4B RL on Agentic Self-Instruct data
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3.5-4B RL on Agentic Self-Instruct dataAlgorithm=GRPO, Data size=1.3k, Training Data=Agentic Self-Instruct2026.06 | 77.4 | 89.4 | |
| Qwen3.5-4B RL on CoT Self-Instruct dataAlgorithm=GRPO, Data size=1.3k, Training Data=CoT Self-Instruct2026.06 | 72.7 | 85.3 | |
| Qwen3.5-4BRL Training=None2026.06 | 63 | 75.8 |