Factual Grounding on FACTS grounding v2
20.09Factual Grounding Score (FACTS-v2)ODRPO Gini (GRPO)
Evaluation Results
| Method | Links | |
|---|---|---|
| ODRPO Gini (GRPO)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=GRPO2026.05 | 20.09 | |
| ODRPO Gini-Med (GRPO)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=GRPO2026.05 | 19.98 | |
| GRPOPolicy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=GRPO2026.05 | 19.04 | |
| ODRPO Gini-Med (MaxRL)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=MaxRL2026.05 | 16.29 | |
| ODRPO Gini (MaxRL)Policy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=MaxRL2026.05 | 15.95 | |
| MaxRLPolicy Model=Qwen2.5-7B-Instruct, Optimization Algorithm=MaxRL2026.05 | 14.19 | |
| ODRPO Gini-Med (MaxRL)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=MaxRL2026.05 | 13.32 | |
| ODRPO Gini (GRPO)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=GRPO2026.05 | 13.02 | |
| ODRPO Gini-Med (GRPO)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=GRPO2026.05 | 12.97 | |
| ODRPO Gini (MaxRL)Policy Model=Qwen3-4B-Instruct, Optimization Algorithm=MaxRL2026.05 | 12.74 | |
| GRPOPolicy Model=Qwen3-4B-Instruct, Optimization Algorithm=GRPO2026.05 | 12.15 | |
| MaxRLPolicy Model=Qwen3-4B-Instruct, Optimization Algorithm=MaxRL2026.05 | 11.74 |