Code Generation on HumanEval+ (SR, LLM%)
98.8SRLLM-only
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLM-onlyBackbones=Averaged over Gemma-9B, LLaMA-3.1-8B, Qwen2.5-7B, Qwen2.5-14B2026.05 | 98.8 | 100 | |
| Oracle RouterBackbones=Averaged over Gemma-9B, LLaMA-3.1-8B, Qwen2.5-7B, Qwen2.5-14B, Mode=Non-deployable hindsight diagnostic2026.05 | 98.6 | 8.1 | |
| Heuristic RouterBackbones=Averaged over Gemma-9B, LLaMA-3.1-8B, Qwen2.5-7B, Qwen2.5-14B, Escalation Mechanism=Non-learned verifier rules2026.05 | 97.4 | 26.6 | |
| R2VBackbones=Averaged over Gemma-9B, LLaMA-3.1-8B, Qwen2.5-7B, Qwen2.5-14B, alpha=0.20, epsilon=0.102026.05 | 94.3 | 0.6 | |
| Entropy RouterBackbones=Averaged over Gemma-9B, LLaMA-3.1-8B, Qwen2.5-7B, Qwen2.5-14B, Escalation Mechanism=Validation-calibrated token-entropy threshold2026.05 | 92.9 | 0.8 | |
| SLM-onlyBackbones=Averaged over Gemma-9B, LLaMA-3.1-8B, Qwen2.5-7B, Qwen2.5-14B2026.05 | 91.9 | 0 |