Legal Reasoning on PRBench-Legal Hard 250-prompt
31.5GPT-5 Grader ScoreQwen3.5-4B RL on Agentic Self-Instruct data
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3.5-4B RL on Agentic Self-Instruct dataRL training data=Agentic Self-Instruct, Base model size=4B2026.06 | 31.5 | 26.6 | |
| Qwen3.5-397BRL training data=no additional RL, Base model size=397B2026.06 | 27.7 | 22.6 | |
| Qwen3.5-4B RL on CoT Self-Instruct dataRL training data=CoT Self-Instruct, Base model size=4B2026.06 | 25.3 | 23.3 | |
| Qwen3.5-4BRL training data=no additional RL, Base model size=4B2026.06 | 16.7 | 14.5 |