Preference Modeling on Arena-Hard V2
73.2Win RateNanbeige4.1-3B
Evaluation Results
| Method | Links | |
|---|---|---|
| Nanbeige4.1-3BParameters=3B2026.02 | 73.2 | |
| Qwen3-Next-80B-A3BParameters=80B2026.02 | 62.3 | |
| Qwen3-30B-A3B-2507Parameters=30B2026.02 | 60.2 | |
| Nanbeige4-3B-2511Parameters=3B2026.02 | 60 | |
| Qwen3-32BParameters=32B2026.02 | 56 | |
| Qwen3-4B-2507Parameters=4B2026.02 | 34.9 | |
| JSBackbone=Llama-3.2-3B-Instruct, Reward Model=8B, Epochs=12025.11 | 7.4 | |
| RLOOBackbone=Llama-3.2-3B-Instruct, Reward Model=8B, Epochs=12025.11 | 5.6 | |
| Llama-3.2-3B-It2025.11 | 2.4 |