Multi-objective personalized alignment on Multifaceted dataset (test)
75AMRMATO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MATOBackbone LLM=Qwen3-8B, Judge=GPT-4o2026.05 | 75 | 4.3 | 3.42 | |
| OPADBackbone LLM=Qwen3-8B, Judge=GPT-4o2026.05 | 74 | 4.28 | 3.39 | |
| MATOBackbone LLM=Llama-3.1-8B, Judge=GPT-4o2026.05 | 73 | 4.08 | 3.22 | |
| Linear AlignmentBackbone LLM=Qwen3-8B, Judge=GPT-4o2026.05 | 72 | 4.19 | 3.31 | |
| Preference PromptBackbone LLM=Qwen3-8B, Judge=GPT-4o2026.05 | 70 | 4.19 | 3.23 | |
| OPADBackbone LLM=Llama-3.1-8B, Judge=GPT-4o2026.05 | 68 | 4.03 | 3.1 | |
| CoSBackbone LLM=Qwen3-8B, Judge=GPT-4o2026.05 | 66 | 4 | 3.13 | |
| Preference PromptBackbone LLM=Llama-3.1-8B, Judge=GPT-4o2026.05 | 66 | 3.97 | 2.96 | |
| Linear AlignmentBackbone LLM=Llama-3.1-8B, Judge=GPT-4o2026.05 | 64 | 3.87 | 2.98 | |
| AmuletBackbone LLM=Qwen3-8B, Judge=GPT-4o2026.05 | 60 | 3.79 | 2.94 | |
| CoSBackbone LLM=Llama-3.1-8B, Judge=GPT-4o2026.05 | 52 | 3.52 | 2.63 | |
| Base LLMBackbone LLM=Qwen3-8B, Judge=GPT-4o2026.05 | 43 | 3.66 | 2.34 | |
| MATOBackbone LLM=Llama-3.2-1B, Judge=GPT-4o2026.05 | 39 | 3.23 | 2.25 | |
| Linear AlignmentBackbone LLM=Llama-3.2-1B, Judge=GPT-4o2026.05 | 37 | 2.78 | 2.11 | |
| OPADBackbone LLM=Llama-3.2-1B, Judge=GPT-4o2026.05 | 36 | 2.99 | 1.88 | |
| Base LLMBackbone LLM=Llama-3.1-8B, Judge=GPT-4o2026.05 | 34 | 3.36 | 2.04 | |
| AmuletBackbone LLM=Llama-3.1-8B, Judge=GPT-4o2026.05 | 32 | 2.92 | 2.07 | |
| Preference PromptBackbone LLM=Llama-3.2-1B, Judge=GPT-4o2026.05 | 31 | 3.07 | 2 | |
| MATOBackbone LLM=Qwen3-0.6B, Judge=GPT-4o2026.05 | 27 | 2.99 | 1.87 | |
| OPADBackbone LLM=Qwen3-0.6B, Judge=GPT-4o2026.05 | 25 | 2.97 | 1.8 | |
| Linear AlignmentBackbone LLM=Qwen3-0.6B, Judge=GPT-4o2026.05 | 24 | 2.8 | 1.76 | |
| Base LLMBackbone LLM=Llama-3.2-1B, Judge=GPT-4o2026.05 | 21 | 2.78 | 1.69 | |
| Preference PromptBackbone LLM=Qwen3-0.6B, Judge=GPT-4o2026.05 | 19 | 2.78 | 1.64 | |
| CoSBackbone LLM=Qwen3-0.6B, Judge=GPT-4o2026.05 | 19 | 2.59 | 1.64 | |
| CoSBackbone LLM=Llama-3.2-1B, Judge=GPT-4o2026.05 | 17 | 2.34 | 1.6 | |
| Base LLMBackbone LLM=Qwen3-0.6B, Judge=GPT-4o2026.05 | 14 | 2.58 | 1.49 | |
| AmuletBackbone LLM=Qwen3-0.6B, Judge=GPT-4o2026.05 | 12 | 2.31 | 1.46 | |
| AmuletBackbone LLM=Llama-3.2-1B, Judge=GPT-4o2026.05 | 12 | 2.06 | 1.42 |