Mixed reasoning tasks on Mixed workload n = 450
74.7Exact-match AccuracyFlat
Evaluation Results
| Method | Links | |
|---|---|---|
| FlatModel=gpt-oss-120b2026.06 | 74.7 | |
| accept-only ablationModel=gpt-oss-120b2026.06 | 73.6 | |
| Transactional leadershipModel=gpt-oss-120b2026.06 | 73.1 | |
| Situational leadershipModel=gpt-oss-120b2026.06 | 71.8 | |
| Theory-free controlModel=gpt-oss-120b2026.06 | 70.9 | |
| Transformational leadershipModel=gpt-oss-120b2026.06 | 70.7 | |
| directives-only ablationModel=gpt-oss-120b2026.06 | 70.4 | |
| Situational leadershipModel=llama-4-scout2026.06 | 70.4 | |
| Transformational leadershipModel=gemma-4-31B-it2026.06 | 70.4 | |
| Theory-free controlModel=gemma-4-31B-it2026.06 | 70 | |
| FlatModel=llama-4-scout2026.06 | 69.8 | |
| Theory-free controlModel=llama-4-scout2026.06 | 69.8 | |
| Situational leadershipModel=gemma-4-31B-it2026.06 | 69.8 | |
| accept-only ablationModel=llama-4-scout2026.06 | 69.3 | |
| Transactional leadershipModel=llama-4-scout2026.06 | 69.1 | |
| FlatModel=gemma-4-31B-it2026.06 | 68.4 | |
| directives-only ablationModel=gemma-4-31B-it2026.06 | 68.4 | |
| directives-only ablationModel=llama-4-scout2026.06 | 68.2 | |
| Transformational leadershipModel=llama-4-scout2026.06 | 67.8 | |
| Transactional leadershipModel=gemma-4-31B-it2026.06 | 67.6 | |
| accept-only ablationModel=gemma-4-31B-it2026.06 | 67.6 |