General Chat on WildBench 2025 (test)
1,062.4WB-EloSR-GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SR-GRPOModel=Qwen2.5-1.5B-Instruct2025.12 | 1,062.4 | |
| RMModel=Qwen2.5-1.5B-Instruct2025.12 | 1,043.3 | |
| Self-RewardModel=Qwen2.5-1.5B-Instruct2025.12 | 1,041.2 | |
| PerplexityModel=Qwen2.5-1.5B-Instruct2025.12 | 1,040.9 | |
| IPOModel=Qwen2.5-1.5B-Instruct2025.12 | 1,037.7 | |
| BaseModel=Qwen2.5-1.5B-Instruct2025.12 | 1,036.2 | |
| SR-GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 932.5 | |
| IPOModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 922.4 | |
| Self-RewardModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 919.2 | |
| RMModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 918.4 | |
| PerplexityModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 917 | |
| BaseModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 913.5 |