General Alignment on FACTS-grounding Alpaca-Evals and IFEval Aggregate v2
48.07Mean ScoreODRPO Gini-Med (GRPO)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ODRPO Gini-Med (GRPO)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=GRPO2026.05 | 48.07 | 2.4728 | |
| ODRPO Gini (GRPO)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=GRPO2026.05 | 47.49 | 1.2364 | |
| GRPOPolicy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=GRPO2026.05 | 46.91 | 0 | |
| ODRPO Gini-Med (MaxRL)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=MaxRL2026.05 | 45.97 | 3.2802 | |
| ODRPO Gini (MaxRL)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=MaxRL2026.05 | 45.79 | 2.8758 | |
| ODRPO Gini-Med (MaxRL)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=MaxRL2026.05 | 45.24 | 3.3113 | |
| ODRPO Gini-Med (GRPO)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=GRPO2026.05 | 44.86 | 1.4703 | |
| ODRPO Gini (MaxRL)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=MaxRL2026.05 | 44.83 | 2.375 | |
| ODRPO Gini (GRPO)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=GRPO2026.05 | 44.77 | 1.2667 | |
| MaxRLPolicy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=MaxRL2026.05 | 44.51 | 0 | |
| GRPOPolicy Model=Qwen3-4B-Instruct, Optimization Algorithm=GRPO2026.05 | 44.21 | 0 | |
| MaxRLPolicy Model=Qwen3-4B-Instruct, Optimization Algorithm=MaxRL2026.05 | 43.79 | 0 |