Multi-task Language Understanding on MMLU all-subjects (test)
94.4AccuracyB1 (3-sample vote)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| B1 (3-sample vote)Protocol=B1, Agents=GPT-5, Claude-Opus-4-6, Gemini-2.5-Pro, Judge=Claude-Opus-4-62026.05 | 94.4 | 1 | 3 | 12 | 198 | |
| B3 (Wald-SPRT)Protocol=B3, Agents=GPT-5, Claude-Opus-4-6, Gemini-2.5-Pro, Judge=Claude-Opus-4-6, alpha=0.05, beta=0.05, Rmax=82026.05 | 94.2 | 7.99 | 31.96 | 116.1 | 191 | |
| B2 (Fixed-5 baseline)Protocol=B2, Agents=GPT-5, Claude-Opus-4-6, Gemini-2.5-Pro, Judge=Claude-Opus-4-62026.05 | 93.8 | 5 | 15 | 52.5 | 195 |