LLM as a Judge on PRISM (test)
58.9AccuracySynthesizeMe
Evaluation Results
| Method | Links | |
|---|---|---|
| SynthesizeMeBackbone=GPT4o-mini2025.06 | 58.9 | |
| SynthesizeMeBackbone=Gemini-2.5-Flash2025.06 | 58.36 | |
| SynthesizeMeBackbone=Gemini-2.0-Flash2025.06 | 57.8 | |
| SynthesizeMeBackbone=Gemini-2.5-Pro2025.06 | 57.76 | |
| SynthesizeMeBackbone=Qwen2-30B-A3B2025.06 | 57.37 | |
| Gemini-2.0-FlashPrompting=Default2025.06 | 56.97 | |
| SynthesizeMeBackbone=Qwen2-32B2025.06 | 56.74 | |
| Gemini-2.5-FlashPrompting=Default2025.06 | 56.66 | |
| Gemini-2.5-ProPrompting=Default2025.06 | 56.51 | |
| Qwen2-30B-A3BPrompting=Default2025.06 | 56.32 | |
| Qwen2-32BPrompting=Default2025.06 | 56.22 | |
| GPT4o-miniPrompting=Default2025.06 | 56.07 | |
| SynthesizeMeBackbone=Qwen2-8B2025.06 | 55.95 | |
| Qwen2-8BPrompting=Default2025.06 | 55.14 |