General Language Intelligence on Aggregate (MIF, MMMLU, GPQA, ARC-C, BBH, MATH, GSM8K)
58.24Mean AccuracyBaseline
Evaluation Results
| Method | Links | |
|---|---|---|
| BaselineN=16, setting=English occurrence as language confusion, aggregation=Averaged across four models and four target languages2026.04 | 58.24 | |
| TLPON=16, setting=English occurrence as language confusion, aggregation=Averaged across four models and four target languages2026.04 | 56.17 | |
| ORPON=16, setting=English occurrence as language confusion, aggregation=Averaged across four models and four target languages2026.04 | 54.61 | |
| DPON=16, setting=English occurrence as language confusion, aggregation=Averaged across four models and four target languages2026.04 | 54.6 | |
| SFTN=16, setting=English occurrence as language confusion, aggregation=Averaged across four models and four target languages2026.04 | 50.71 |