Factuality Question Answering on SampleQA (Accuracy %)
3.21Accuracy (%)VRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| VRPOModel Scale=Qwen3-8B2025.08 | 3.21 | |
| VRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=VRPO2025.08 | 3.21 | |
| Reinforce++Model Scale=Qwen3-8B2025.08 | 3.19 | |
| Reinforce++Model Backbone=Qwen3-8B(Strong Model), Optimization Method=Reinforce++2025.08 | 3.19 | |
| KTAEModel Scale=Qwen3-8B2025.08 | 3.17 | |
| GRPOModel Scale=Qwen3-8B2025.08 | 3.03 | |
| GRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=GRPO2025.08 | 3.03 | |
| BaseModel Scale=Qwen3-8B2025.08 | 2.89 | |
| BaseModel Backbone=Qwen3-8B(Strong Model), Optimization Method=Base2025.08 | 2.89 | |
| PPOModel Scale=Qwen3-8B2025.08 | 2.82 | |
| VRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=VRPO2025.08 | 2.82 | |
| PPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=PPO2025.08 | 2.82 | |
| λ-GRPOModel Scale=Qwen3-8B2025.08 | 2.77 | |
| Reinforce++Model Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Reinforce++2025.08 | 2.64 | |
| VRPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 2.61 | |
| PPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=PPO2025.08 | 2.54 | |
| Dr.GRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Dr.GRPO2025.08 | 2.54 | |
| Dr.GRPOModel Scale=Qwen3-8B2025.08 | 2.5 | |
| Dr.GRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=Dr.GRPO2025.08 | 2.5 | |
| GRPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 2.47 | |
| PPOOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 2.43 | |
| BaseModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Base2025.08 | 2.36 | |
| GRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=GRPO2025.08 | 2.36 | |
| PPOModel Scale=Qwen3-1.7B2025.08 | 1.91 | |
| BaseModel Scale=Qwen3-1.7B2025.08 | 1.78 | |
| KTAEModel Scale=Qwen3-1.7B2025.08 | 1.64 | |
| λ-GRPOModel Scale=Qwen3-1.7B2025.08 | 1.62 | |
| Cold StartOptimization Type=test-time optimization, Reward Type=rule-based rewards2025.08 | 1.62 | |
| GRPOModel Scale=Qwen3-1.7B2025.08 | 1.6 | |
| Dr.GRPOModel Scale=Qwen3-1.7B2025.08 | 1.5 | |
| VRPOModel Scale=Qwen3-1.7B2025.08 | 1.5 | |
| Reinforce++Model Scale=Qwen3-1.7B2025.08 | 1.48 |