Medical Question Answering on MedMCQA (Pass@1)
53.6Pass@1 AccuracyQwen2.5-7B + PPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-7B + PPOBase Model=Qwen2.5-7B, Training=PPO2025.09 | 53.6 | |
| Qwen2.5-7B + PPO w/ VERL.Base Model=Qwen2.5-7B, Training=PPO w/ VERL.2025.09 | 52.9 | |
| Qwen2.5-7B + GRPOBase Model=Qwen2.5-7B, Training=GRPO2025.09 | 52.1 | |
| Qwen2.5-7B + GRPO w/ VERL.Base Model=Qwen2.5-7B, Training=GRPO w/ VERL.2025.09 | 52 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B2025.09 | 50.6 | |
| Qwen3-1.7BTrain Size=100%2026.05 | 48.54 | |
| SHIFTTrain Size=0.2%2026.05 | 48.47 | |
| SHIFTTrain Size=0.1%2026.05 | 48.3 | |
| SC-EntropyTrain Size=0.2%2026.05 | 47.37 | |
| ClusterTrain Size=0.2%2026.05 | 47.3 | |
| Mathstral-7B-v0.1 + GRPO w/ VERL.Base Model=Mathstral-7B-v0.1, Training=GRPO w/ VERL.2025.09 | 47.1 | |
| Random (avg)Train Size=0.2%2026.05 | 46.97 | |
| A-PPLTrain Size=0.2%2026.05 | 46.52 | |
| CoreSetTrain Size=0.2%2026.05 | 46.48 | |
| SC-EntropyTrain Size=0.1%2026.05 | 46.38 | |
| CoT SimilarityTrain Size=0.1%2026.05 | 46.09 | |
| Random (avg)Train Size=0.1%2026.05 | 45.91 | |
| ClusterTrain Size=0.1%2026.05 | 45.88 | |
| Q-PPLTrain Size=0.2%2026.05 | 45.88 | |
| CoT SimilarityTrain Size=0.2%2026.05 | 45.85 | |
| Q-PPLTrain Size=0.1%2026.05 | 45.53 | |
| A-PPLTrain Size=0.1%2026.05 | 45.17 | |
| Mathstral-7B-v0.1 + GRPOBase Model=Mathstral-7B-v0.1, Training=GRPO2025.09 | 44.9 | |
| CoreSetTrain Size=0.1%2026.05 | 44.89 | |
| Mathstral-7B-v0.1 + PPO w/ VERL.Base Model=Mathstral-7B-v0.1, Training=PPO w/ VERL.2025.09 | 44.8 | |
| Mathstral-7B-v0.1 + PPOBase Model=Mathstral-7B-v0.1, Training=PPO2025.09 | 44.2 | |
| Mathstral-7B-v0.1Base Model=Mathstral-7B-v0.12025.09 | 42.9 | |
| Qwen3-1.7BTrain Size=N/A2026.05 | 40.98 |