Language Model Evaluation across Subsets on ELEPHANT
93OEQ Validation ScoreQwen3-80B
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Qwen3-80BCondition=baseline2026.01 | 93 | 55 | 8 | 85 | 28 | 18 | 20 | |
| Gemini-2.5-ProCondition=baseline2026.01 | 89 | 55 | 21 | 77 | 36 | 33 | 29 | |
| Qwen3-80BCondition=WAIT2026.01 | 71 | 31 | 1 | 82 | 20 | 14 | -6 | |
| Qwen3-80BCondition=EXPLICIT2026.01 | 68 | 30 | -9 | 75 | 13 | -35 | -42 | |
| Gemini-2.5-ProCondition=EXPLICIT2026.01 | 67 | 33 | -22 | 76 | 36 | -27 | -23 | |
| GPT-4oCondition=EXPLICIT2026.01 | 67 | 72 | -9 | 58 | 75 | -3 | -16 | |
| Claude-Sonnet-4Condition=baseline2026.01 | 60 | 58 | 24 | 71 | 33 | 29 | 25 | |
| Llama-8BCondition=baseline2026.01 | 59 | 73 | 30 | 58 | 75 | 35 | 32 | |
| GPT-4oCondition=WAIT2026.01 | 57 | 67 | 34 | 70 | 66 | 41 | 34 | |
| Llama-70BCondition=baseline2026.01 | 56 | 73 | 30 | 51 | 44 | 40 | 31 | |
| GPT-4oCondition=baseline2026.01 | 56 | 78 | 34 | 76 | 87 | 34 | 34 | |
| Gemini-2.5-ProCondition=WAIT2026.01 | 49 | 36 | 10 | 44 | 37 | 20 | 33 | |
| Claude-Sonnet-4Condition=EXPLICIT2026.01 | 46 | 41 | -20 | 49 | 19 | -21 | -19 | |
| Claude-Sonnet-4Condition=WAIT2026.01 | 44 | 42 | 6 | 56 | 26 | 9 | -6 | |
| Llama-8BCondition=WAIT2026.01 | 42 | 69 | 31 | 38 | 56 | 42 | 24 | |
| Llama-70BCondition=EXPLICIT2026.01 | 41 | 72 | -33 | 23 | 84 | -20 | -40 | |
| Llama-70BCondition=WAIT2026.01 | 40 | 66 | 31 | 41 | 52 | 45 | 30 | |
| Llama-8BCondition=EXPLICIT2026.01 | 33 | 66 | 5 | 16 | 64 | -1 | -27 |