Human Preference Evaluation on Oral Argument Simulation (Evaluation set)
72WinsGemini-2.5-Pro
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Gemini-2.5-ProSimulation Mode=AGENT2026.03 | 72 | 31 | 25 | 55.6 | 15.8 | |
| Llama-3.3-70B-InstructSimulation Mode=PROMPT2026.03 | 66 | 37 | 34 | 54.6 | 9.9 | |
| GPT-4oSimulation Mode=PROMPT2026.03 | 62 | 46 | 31 | 51 | 8.6 | |
| Gemini-2.5-ProSimulation Mode=PROMPT2026.03 | 62 | 41 | 26 | 49.3 | 15.1 | |
| Ground Truth2026.03 | 46 | 55 | 33 | 41.1 | 11.8 | |
| GPT-4oSimulation Mode=AGENT2026.03 | 45 | 52 | 32 | 40.1 | 15.1 | |
| Qwen3-32BSimulation Mode=PROMPT2026.03 | 42 | 58 | 24 | 35.5 | 18.4 | |
| GPT-OSS-120BSimulation Mode=PROMPT2026.03 | 36 | 60 | 28 | 32.9 | 18.4 | |
| GPT-OSS-120BSimulation Mode=AGENT2026.03 | 24 | 75 | 17 | 21.4 | 23.7 |