Risk-of-bias assessment in medical systematic reviews on COCHRANEFOREST (test)
0.895CoherenceQwen2.5-7B-GRPO-VPRM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-7B-GRPO-VPRMTraining Algorithm=GRPO, Reward Model=VPRM2026.01 | 0.895 | 0.75 | |
| Qwen2.5-7B-DAPO-VPRMTraining Algorithm=DAPO, Reward Model=VPRM2026.01 | 0.801 | 0.694 | |
| Llama-3.1-405BModel Type=Pretrained LLM2026.01 | 0.507 | 0.271 | |
| Qwen2.5-72BModel Type=Pretrained LLM2026.01 | 0.443 | 0.249 | |
| GPT-OSS-120BModel Type=Pretrained LLM2026.01 | 0.362 | 0.285 |