General Chat on Arena-Hard Vanilla
0.492Win RatePROSPER
Evaluation Results
| Method | Links | |
|---|---|---|
| PROSPERBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 0.492 | |
| PROSPER-VBBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 0.476 | |
| PROSPER-JCBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 0.442 | |
| RLCFBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 0.426 | |
| Qwen2.5-7B-InstructModel Scale=7B, LLM Judge=gpt-5-mini2026.02 | 0.424 |