Multi-domain Evaluation on HealthBench, LLMMed-Eval, WritingBench, Creative Writing, and ResearchQA
70.55Macro-average ScoreEvoRubric
Evaluation Results
| Method | Links | |
|---|---|---|
| EvoRubricBackbone=Qwen3-14B2026.05 | 70.55 | |
| External Evolving-RLBackbone=Qwen3-14B2026.05 | 69.65 | |
| Static Rubric-RLBackbone=Qwen3-14B2026.05 | 69.07 | |
| Gemini-2.5-proBackbone=Proprietary2026.05 | 68.96 | |
| EvoRubricBackbone=Qwen3-8B2026.05 | 68.84 | |
| Static Rubric-RLBackbone=Qwen3-8B2026.05 | 66.31 | |
| External Evolving-RLBackbone=Qwen3-8B2026.05 | 66.16 | |
| Base ModelBackbone=Qwen3-14B2026.05 | 65.22 | |
| GPT-4oBackbone=Proprietary2026.05 | 64.32 | |
| Base ModelBackbone=Qwen3-8B2026.05 | 62.19 |