Overall Performance Evaluation on Aggregate All Domains
38.14Average AccuracyVRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| VRPOModel Scale=Qwen3-8B2025.08 | 38.14 | |
| λ-GRPOModel Scale=Qwen3-8B2025.08 | 37.95 | |
| Reinforce++Model Scale=Qwen3-8B2025.08 | 36.6 | |
| Dr.GRPOModel Scale=Qwen3-8B2025.08 | 36.59 | |
| GRPOModel Scale=Qwen3-8B2025.08 | 35.19 | |
| BaseModel Scale=Qwen3-8B2025.08 | 34.64 | |
| VRPOModel Scale=Qwen3-1.7B2025.08 | 34.56 | |
| PPOModel Scale=Qwen3-8B2025.08 | 34.55 | |
| KTAEModel Scale=Qwen3-8B2025.08 | 34.55 | |
| Reinforce++Model Scale=Qwen3-1.7B2025.08 | 33.26 | |
| λ-GRPOModel Scale=Qwen3-1.7B2025.08 | 32.68 | |
| PPOModel Scale=Qwen3-1.7B2025.08 | 32.51 | |
| GRPOModel Scale=Qwen3-1.7B2025.08 | 32.43 | |
| Dr.GRPOModel Scale=Qwen3-1.7B2025.08 | 32.19 | |
| BaseModel Scale=Qwen3-1.7B2025.08 | 30.78 | |
| KTAEModel Scale=Qwen3-1.7B2025.08 | 23.76 |