Question Answering on MMLU (Accuracy, Avg, ΔScore)
77.84AccuracyQwen3-30BA3B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3-30BA3BModel=Qwen3-30BA3B, Architecture Type=Transformer2025.10 | 77.84 | — | — | |
| NHA-Qwen3-30BA3BModel=NHA-Qwen3-30BA3B, Architecture Type=Native Hybrid Attention, Full-attention layers=32025.10 | 75.51 | — | — | |
| R1-OracleBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=100% GT2026.03 | 0.7222 | 0.7912 | 0 | |
| MemRewardBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=20% GT + GNN2026.03 | 0.72 | 0.7702 | -2.1 | |
| R1-pBackbone=Qwen2.5-3B-Instruct, Supervision Paradigm=20% GT2026.03 | 0.7178 | 0.7567 | -3.45 | |
| R1-OracleBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=100% GT2026.03 | 0.6644 | 0.7047 | 0 | |
| MemRewardBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=20% GT + GNN2026.03 | 0.5467 | 0.681 | -2.37 | |
| R1-pBackbone=Qwen2.5-1.5B-Instruct, Supervision Paradigm=20% GT2026.03 | 0.5333 | 0.6272 | -7.75 |