Preference Alignment on PRISM
74.5Win-Rate (DPO)CUMA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CUMABackbone=Qwen3-8B, Category=Sparsely Activated Adapters, Trainable Params=4.15%, Rank (r)=642026.01 | 74.5 | 76.8 | |
| CUMABackbone=Qwen3-8B, Category=Sparsely Activated Adapters, Trainable Params=1.53%, Rank (r)=82026.01 | 73.2 | 75.5 | |
| CUMABackbone=Llama-3.1-8B, Category=Sparsely Activated Adapters, Trainable Params=4.15%, Rank (r)=642026.01 | 71.2 | 73.5 | |
| CUMABackbone=Llama-3.1-8B, Category=Sparsely Activated Adapters, Trainable Params=1.53%, Rank (r)=82026.01 | 68.8 | 67.5 | |
| HydraLoRABackbone=Qwen3-8B, Category=Sparsely Activated Adapters, Trainable Params=2.31%2026.01 | 68.5 | 70.4 | |
| MixLoRABackbone=Qwen3-8B, Category=Sparsely Activated Adapters, Trainable Params=3.01%2026.01 | 67.5 | 69.2 | |
| HydraLoRABackbone=Llama-3.1-8B, Category=Sparsely Activated Adapters, Trainable Params=2.31%2026.01 | 65.5 | 68.2 | |
| MixLoRABackbone=Llama-3.1-8B, Category=Sparsely Activated Adapters, Trainable Params=3.01%2026.01 | 64.2 | 65.8 | |
| Full Fine-Tuning (FFT)Backbone=Qwen3-8B, Category=Dense Fine-Tuning, Trainable Params=100.0%2026.01 | 63.5 | 65.2 | |
| DoRABackbone=Qwen3-8B, Category=Dense Fine-Tuning, Trainable Params=0.38%, Rank (r)=642026.01 | 62.8 | 64.1 | |
| Full Fine-Tuning (FFT)Backbone=Llama-3.1-8B, Category=Dense Fine-Tuning, Trainable Params=100.0%2026.01 | 61.5 | 63.2 | |
| LoRABackbone=Qwen3-8B, Category=Dense Fine-Tuning, Trainable Params=0.37%, Rank (r)=642026.01 | 61.5 | 62.2 | |
| DoRABackbone=Llama-3.1-8B, Category=Dense Fine-Tuning, Trainable Params=0.38%, Rank (r)=642026.01 | 59.5 | 61.2 | |
| LoRABackbone=Llama-3.1-8B, Category=Dense Fine-Tuning, Trainable Params=0.37%, Rank (r)=642026.01 | 58.8 | 59.5 | |
| Prompt Steering (3-shot)Backbone=Qwen3-8B, Category=Inference-Time Strategies, Trainable Params=0.00%2026.01 | 58.4 | 59.5 | |
| P-Tuning v2Backbone=Qwen3-8B, Category=Dense Fine-Tuning, Trainable Params=0.94%2026.01 | 57.5 | 58.8 | |
| Prompt Steering (3-shot)Backbone=Llama-3.1-8B, Category=Inference-Time Strategies, Trainable Params=0.00%2026.01 | 56.5 | 59.2 | |
| Persona PromptingBackbone=Qwen3-8B, Category=Inference-Time Strategies, Trainable Params=0.00%2026.01 | 56.2 | 57 | |
| P-Tuning v2Backbone=Llama-3.1-8B, Category=Dense Fine-Tuning, Trainable Params=0.94%2026.01 | 55.5 | 56.8 | |
| Persona PromptingBackbone=Llama-3.1-8B, Category=Inference-Time Strategies, Trainable Params=0.00%2026.01 | 55.2 | 55.8 |