Generalization Reasoning on MMLU-Pro (Average@16 accuracy)
61.6Average@16 AccuracyHiLL
Evaluation Results
| Method | Links | |
|---|---|---|
| HiLLBackbone=Qwen2.5-7B-Instruct2026.04 | 61.6 | |
| HiLLw/o TWBackbone=Qwen2.5-7B-Instruct2026.04 | 59.9 | |
| SAGEBackbone=Qwen2.5-7B-Instruct2026.04 | 59.3 | |
| LUFFYBackbone=Qwen2.5-7B-Instruct2026.04 | 59.1 | |
| Scaf-GRPOBackbone=Qwen2.5-7B-Instruct2026.04 | 58.4 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.04 | 57.6 | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.04 | 56.4 | |
| HiLLBackbone=Llama-3.2-3B-Instruct2026.04 | 42.7 | |
| HiLLw/o TWBackbone=Llama-3.2-3B-Instruct2026.04 | 41 | |
| SAGEBackbone=Llama-3.2-3B-Instruct2026.04 | 40.7 | |
| GRPOBackbone=Llama-3.2-3B-Instruct2026.04 | 39.8 | |
| Scaf-GRPOBackbone=Llama-3.2-3B-Instruct2026.04 | 38 | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.04 | 27 | |
| LUFFYBackbone=Llama-3.2-3B-Instruct2026.04 | 26.7 |