Length-Constrained Text Generation on CNN/DailyMail
16.43Win RateMARKERGEN
Evaluation Results
| Method | Links | |
|---|---|---|
| MARKERGENModel Series=Qwen2.5, Size=32B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 16.43 | |
| ImplicitModel Series=Qwen2.5, Size=32B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 15.8 | |
| MARKERGENModel Series=Qwen2.5, Size=7B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 14.8 | |
| ImplicitModel Series=Llama3.1, Size=8B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 12.27 | |
| MARKERGENModel Series=Qwen2.5, Size=14B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 11.6 | |
| MARKERGENModel Series=Llama3.1, Size=8B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 10.69 | |
| ImplicitModel Series=Qwen2.5, Size=14B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 9.4 | |
| MARKERGENModel Series=Llama3.1, Size=70B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 9.02 | |
| ImplicitModel Series=Llama3.1, Size=70B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 7.4 | |
| ImplicitModel Series=Qwen2.5, Size=7B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 4.2 |