CS research tasks on Agentic 200-prompt (held-out test)
0.632Mean@3Qwen3.5-4B RL on Agentic Self-Instruct data
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3.5-4B RL on Agentic Self-Instruct dataAlgorithm=GRPO, Data size=1.3k, Training Data=Agentic Self-Instruct2026.06 | 0.632 | 0.768 | |
| Qwen3.5-4B RL on CoT Self-Instruct dataAlgorithm=GRPO, Data size=1.3k, Training Data=CoT Self-Instruct2026.06 | 0.5 | 0.631 | |
| Qwen3.5-4BRL Training=None2026.06 | 0.366 | 0.484 |