General Chat on Arena-Hard Style-Controlled
46.1Win-ratePROSPER
Evaluation Results
| Method | Links | |
|---|---|---|
| PROSPERBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 46.1 | |
| PROSPER-VBBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 45.5 | |
| RLCFBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 45 | |
| Qwen2.5-7B-InstructModel Scale=7B, LLM Judge=gpt-5-mini2026.02 | 44.2 | |
| PROSPER-JCBackbone=Qwen2.5-7B-Instruct, Model Scale=7B, LLM Judge=gpt-5-mini2026.02 | 42 |