Distribution Alignment on Aggregate of Six Datasets
0.082Average MAEKL-Optimized Fine-Tuning
Evaluation Results
| Method | Links | |
|---|---|---|
| KL-Optimized Fine-TuningModel=Qwen2.5-1.5B-Instruct2026.04 | 0.082 | |
| KL-Optimized Fine-TuningModel=Qwen2.5-7B-Instruct2026.04 | 0.085 | |
| IFTModel=Qwen2.5-1.5B-Instruct2026.04 | 0.102 | |
| KL-Optimized Fine-TuningModel=Llama-3.2-1B-Instruct2026.04 | 0.103 | |
| KL-Optimized Fine-TuningModel=Llama-3.1-8B-Instruct2026.04 | 0.116 | |
| IFTModel=Llama-3.1-8B-Instruct2026.04 | 0.131 | |
| IFTModel=Qwen2.5-7B-Instruct2026.04 | 0.135 | |
| IFTModel=Llama-3.2-1B-Instruct2026.04 | 0.142 | |
| Zero-shotModel=Llama-3.1-8B-Instruct2026.04 | 0.222 | |
| PE-ImplicitModel=Qwen2.5-7B-Instruct2026.04 | 0.228 | |
| Zero-shotModel=Qwen2.5-1.5B-Instruct2026.04 | 0.238 | |
| PE-ExplicitModel=Qwen2.5-1.5B-Instruct2026.04 | 0.247 | |
| PE-ImplicitModel=Llama-3.1-8B-Instruct2026.04 | 0.248 | |
| PE-ExplicitModel=Llama-3.1-8B-Instruct2026.04 | 0.25 | |
| Zero-shotModel=Qwen2.5-7B-Instruct2026.04 | 0.267 | |
| PE-ImplicitModel=Qwen2.5-1.5B-Instruct2026.04 | 0.267 | |
| Zero-shotModel=Llama-3.2-1B-Instruct2026.04 | 0.28 | |
| DPOModel=Llama-3.2-1B-Instruct2026.04 | 0.307 | |
| PE-ExplicitModel=Qwen2.5-7B-Instruct2026.04 | 0.311 | |
| DPOModel=Qwen2.5-1.5B-Instruct2026.04 | 0.317 | |
| PE-ExplicitModel=Llama-3.2-1B-Instruct2026.04 | 0.319 | |
| DPOModel=Llama-3.1-8B-Instruct2026.04 | 0.324 | |
| DPOModel=Qwen2.5-7B-Instruct2026.04 | 0.333 | |
| PE-ImplicitModel=Llama-3.2-1B-Instruct2026.04 | 0.351 |