Opinion Alignment on smartvote
73.92Mean AccuracySFT+GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SFT+GRPOBase model=Magistral 24B2026.03 | 73.92 | |
| iclBase model=Magistral 24B2026.03 | 71.41 | |
| SFT+GRPOBase model=Qwen3 8B2026.03 | 71.27 | |
| SFTBase model=Magistral 24B2026.03 | 70.83 | |
| SFT+GRPOBase model=Llama 3.1 8B2026.03 | 70.53 | |
| GRPOBase model=Magistral 24B2026.03 | 68.44 | |
| SFTBase model=Llama 3.1 8B2026.03 | 67.23 | |
| GRPOBase model=Qwen3 8B2026.03 | 67.04 | |
| GRPOBase model=Llama 3.1 8B2026.03 | 66.44 | |
| iclBase model=Qwen3 8B2026.03 | 66.09 | |
| SFTBase model=Qwen3 8B2026.03 | 65.18 | |
| iclBase model=Llama 3.1 8B2026.03 | 63.91 | |
| ORPOBase model=Llama 3.1 8B2026.03 | 59.23 | |
| randomBase model=Untrained baselines2026.03 | 50 | |
| ORPOBase model=Qwen3 8B2026.03 | 39.02 | |
| majorityBase model=Untrained baselines2026.03 | 37.43 | |
| ORPOBase model=Magistral 24B2026.03 | 35.93 |