Instruction Following on CFBench
70AccuracyGemini-3.0-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3.0-ProModel=Gemini-3.0-Pro2026.04 | 70 | |
| Deeepseek-V3.2Model=Deeepseek-V3.22026.04 | 67 | |
| Qwen3-32BModel=Qwen3-32B2026.04 | 64 | |
| TinyJudge-32BModel=Qwen2.5-32B-inst, Reward Model=TinyJudge-32B2026.04 | 64 | |
| Claude-Sonnet-4.5Model=Claude-Sonnet-4.52026.04 | 63 | |
| Qwen2.5-32B-inst RLVRModel=Qwen2.5-32B-inst, Reward Model=Qwen3-32B2026.04 | 60 | |
| Qwen2.5-32B-inst RLVRModel=Qwen2.5-32B-inst, Reward Model=Qwen2.5-32B2026.04 | 58 | |
| Qwen2.5-32B-instModel=Qwen2.5-32B-inst2026.04 | 57 | |
| Qwen3-8BModel=Qwen3-8B2026.04 | 55 | |
| TinyJudge-7BModel=Qwen2.5-7B-inst, Reward Model=TinyJudge-7B2026.04 | 54 | |
| Qwen-IFModel=Qwen-IF, Training Strategy=RLVR-trained2026.04 | 52 | |
| Qwen2.5-7B-inst RLVRModel=Qwen2.5-7B-inst, Reward Model=Qwen3-32B2026.04 | 49 | |
| Qwen2.5-7B-inst RLVRModel=Qwen2.5-7B-inst, Reward Model=Qwen3-8B2026.04 | 48 | |
| Qwen2.5-7B-inst RLVRModel=Qwen2.5-7B-inst, Reward Model=Qwen2.5-32B2026.04 | 48 | |
| Qwen2.5-7B-instModel=Qwen2.5-7B-inst2026.04 | 44 |