Conversational Alignment on Alpaca-Evals
58.12Alpaca-Evals ScoreODRPO Gini-Med (GRPO)
Evaluation Results
| Method | Links | |
|---|---|---|
| ODRPO Gini-Med (GRPO)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=GRPO2026.05 | 58.12 | |
| ODRPO Gini-Med (MaxRL)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=MaxRL2026.05 | 57.21 | |
| ODRPO Gini (GRPO)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=GRPO2026.05 | 57.11 | |
| GRPOPolicy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=GRPO2026.05 | 56.91 | |
| ODRPO Gini (MaxRL)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=MaxRL2026.05 | 56.91 | |
| ODRPO Gini (GRPO)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=GRPO2026.05 | 56.61 | |
| ODRPO Gini-Med (GRPO)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=GRPO2026.05 | 56.41 | |
| ODRPO Gini (MaxRL)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=MaxRL2026.05 | 56.34 | |
| ODRPO Gini-Med (MaxRL)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=MaxRL2026.05 | 55.97 | |
| MaxRLPolicy Model=Qwen3-4B-Instruct, Optimization Algorithm=MaxRL2026.05 | 55.33 | |
| GRPOPolicy Model=Qwen3-4B-Instruct, Optimization Algorithm=GRPO2026.05 | 55.29 | |
| MaxRLPolicy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=MaxRL2026.05 | 53.23 |