LLM Chat Evaluation on ArenaHard
49.2AccuracyOfficial Instruct Model
Evaluation Results
| Method | Links | |
|---|---|---|
| Official Instruct ModelProtocol=Official Instruct, Backbone=SmolLM3-3B2026.05 | 49.2 | |
| GLM-4.7 (Scaffold-only)Protocol=Proposed Method, Backbone=SmolLM3-3B2026.05 | 17.32 | |
| GPT-5.4 (High)Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 14.34 | |
| GLM-4.7 & ANDES (Ours)Protocol=Proposed Method, Backbone=SmolLM3-3B2026.05 | 14.11 | |
| Opus-4.7 (xHigh)Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 10.21 | |
| Opus-4.6 (1M)Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 9 | |
| Opus-4.6Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 7.78 | |
| GPT-5.2Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 6.49 | |
| Gemini-3.1-ProProtocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 6.42 | |
| MiniMax-M2.5Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 2.18 | |
| Base Model (SmolLM3-3B)Protocol=Zero-Shot, Backbone=SmolLM3-3B2026.05 | 0.42 | |
| Kimi-K2-ThinkingProtocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 0.42 | |
| MiniMax-M2.1Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 0.42 | |
| GPT-5.1-Codex-MaxProtocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 0.42 | |
| GLM-4.7 (OpenCode)Protocol=Proposed Method, Backbone=SmolLM3-3B2026.05 | 0.42 | |
| Sonnet-4.5Protocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 0.24 | |
| Qwen3-MaxProtocol=Agent-Post-Trained, Backbone=SmolLM3-3B2026.05 | 0.21 |