Question Answering on MMLU Redux (Subject-Specific Accuracy)
77.5Business Ethics AccuracyGPT-5
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT-5Action Policy=Qwen3-4B-Instruct2026.03 | 77.5 | 80 | 73 | 83.5 | 81 | 70 | 82 | 64.8 | 55.5 | 58 | 72.5 | |
| GEPAAction Policy=Qwen3-4B-Instruct2026.03 | 76 | 80 | 78 | 84 | 82 | 70 | 78 | 62 | 56 | 64 | 73 | |
| Qwen3-4B-InstructAction Policy=Qwen3-4B-Instruct2026.03 | 75.5 | 79.2 | 73 | 83 | 82.3 | 68.8 | 77 | 59.7 | 56 | 57.3 | 71.2 | |
| Claude Sonnet 4.5Action Policy=Qwen3-4B-Instruct2026.03 | 75.3 | 79 | 75.5 | 81 | 79.8 | 69.3 | 77.5 | 67.3 | 57 | 58.5 | 72 | |
| LSEAction Policy=Qwen3-4B-Instruct2026.03 | 75 | 82 | 73 | 85 | 84.5 | 70.5 | 79 | 64.5 | 57 | 62 | 73.3 | |
| TextGradAction Policy=Qwen3-4B-Instruct2026.03 | 74 | 79 | 67.8 | 73.3 | 80 | 67.8 | 77.3 | 62.5 | 51.3 | 58.3 | 69.1 | |
| Seed promptAction Policy=Qwen3-4B-Instruct2026.03 | 70.5 | 76 | 67.7 | 76.2 | 76 | 68.2 | 72.5 | 59.7 | 55.5 | 54 | 67.6 |