Binary decision task on LAPOP (test)
70.22AccuracyOG-MAR
Evaluation Results
| Method | Links | |
|---|---|---|
| OG-MARBackbone=EXAONE 3.52026.01 | 70.22 | |
| OG-MARBackbone=Gemini 2.5 Flash Lite2026.01 | 63.85 | |
| OG-MARBackbone=GPT-4o mini2026.01 | 62.68 | |
| Self-consistencyBackbone=Gemini 2.5 Flash Lite2026.01 | 62.68 | |
| Zero-shotBackbone=Gemini 2.5 Flash Lite2026.01 | 62.25 | |
| ValuesRAGBackbone=GPT-4o mini2026.01 | 60.85 | |
| OG-MARBackbone=QWEN 2.52026.01 | 60.05 | |
| ValuesRAGBackbone=EXAONE 3.52026.01 | 59.13 | |
| RoleBackbone=Gemini 2.5 Flash Lite2026.01 | 58.52 | |
| Zero-shotBackbone=GPT-4o mini2026.01 | 57.6 | |
| RoleBackbone=GPT-4o mini2026.01 | 56.74 | |
| Self-consistencyBackbone=GPT-4o mini2026.01 | 55.51 | |
| Self-consistencyBackbone=EXAONE 3.52026.01 | 53.68 | |
| ValuesRAGBackbone=Gemini 2.5 Flash Lite2026.01 | 53.39 | |
| DebateBackbone=Gemini 2.5 Flash Lite2026.01 | 53.31 | |
| DebateBackbone=GPT-4o mini2026.01 | 53.06 | |
| ValuesRAGBackbone=QWEN 2.52026.01 | 52.68 | |
| Zero-shotBackbone=EXAONE 3.52026.01 | 50.06 | |
| Self-consistencyBackbone=QWEN 2.52026.01 | 49.75 | |
| DebateBackbone=EXAONE 3.52026.01 | 49.39 | |
| Zero-shotBackbone=QWEN 2.52026.01 | 49.08 | |
| RoleBackbone=QWEN 2.52026.01 | 47.12 | |
| RoleBackbone=EXAONE 3.52026.01 | 46.02 | |
| DebateBackbone=QWEN 2.52026.01 | 43.32 |