Question Answering on SuperGPQA Law
43.8AccuracyLlama3.1-70B
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama3.1-70BPost-Training Stage=DPO2026.01 | 43.8 | |
| Qwen3-30BPost-Training Stage=DPO2026.01 | 42.5 | |
| Qwen3-30BPost-Training Stage=OOB2026.01 | 42.4 | |
| Qwen3-30BPost-Training Stage=SFT2026.01 | 42.1 | |
| Llama3.1-70BPost-Training Stage=SFT2026.01 | 41.7 | |
| Llama3.1-70BPost-Training Stage=OOB2026.01 | 40.3 | |
| Nemotron1.5-49BPost-Training Stage=DPO2026.01 | 38 | |
| Nemotron1.5-49BPost-Training Stage=OOB2026.01 | 37.7 | |
| Nemotron1.5-49BPost-Training Stage=SFT2026.01 | 37.6 | |
| SaulLMParameters=141B2026.01 | 28.4 |