Free-form answer generation on KLAR (train)
49.69AccuracyGRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPOBackbone=Qwen-2.5-7B2026.06 | 49.69 | |
| BaselineBackbone=Qwen-2.5-7B2026.06 | 47.68 | |
| CPT + GRPOBackbone=Qwen-2.5-7B2026.06 | 45.97 | |
| CPT + SFTBackbone=Qwen-2.5-7B2026.06 | 45.43 | |
| SFTBackbone=Qwen-2.5-7B2026.06 | 43.23 | |
| CPTBackbone=Qwen-2.5-7B2026.06 | 38.99 | |
| CPT + GRPOBackbone=OLMo-2-1124-7B2026.06 | 29.8 | |
| GRPOBackbone=OLMo-2-1124-7B2026.06 | 29 | |
| BaselineBackbone=OLMo-2-1124-7B2026.06 | 24.6 | |
| CPT + SFTBackbone=OLMo-2-1124-7B2026.06 | 20.7 | |
| SFTBackbone=OLMo-2-1124-7B2026.06 | 18.1 | |
| CPTBackbone=OLMo-2-1124-7B2026.06 | 17 |