Multiple-choice Question Answering on MMLU-Pro Overall (test)
0.2456Mean Entropy (R1)DeepSeek V3.2
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| DeepSeek V3.2Static Entropy Threshold (tau_H)=1.3 nats, Static Max Probability Threshold (tau_MSP)=0.4, Inference Protocol=Reinforcement Inference2026.02 | 0.2456 | 0.7546 | 0.1917 | 0.7872 | 75.99 | 78.7 | 20.96 | |
| Qwen3 30BStatic Entropy Threshold (tau_H)=1.3 nats, Static Max Probability Threshold (tau_MSP)=0.4, Inference Protocol=Reinforcement Inference2026.02 | 1.2881 | 0.4292 | 1.3041 | 0.43 | 76.37 | 77.25 | 57.5 | |
| Qwen3 235BStatic Entropy Threshold (tau_H)=1.3 nats, Static Max Probability Threshold (tau_MSP)=0.4, Inference Protocol=Reinforcement Inference2026.02 | 1.416 | 0.3753 | 1.4414 | 0.3752 | 81.44 | 82.58 | 65.24 |