Length-Constrained Text Generation on HANNA
23Win RateMARKERGEN
Evaluation Results
| Method | Links | |
|---|---|---|
| MARKERGENModel Series=Qwen2.5, Size=32B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 23 | |
| MARKERGENModel Series=Qwen2.5, Size=7B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 16.67 | |
| MARKERGENModel Series=Qwen2.5, Size=14B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 11 | |
| ImplicitModel Series=Qwen2.5, Size=14B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 7.04 | |
| ImplicitModel Series=Qwen2.5, Size=32B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 6.5 | |
| MARKERGENModel Series=Llama3.1, Size=70B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 6.03 | |
| MARKERGENModel Series=Llama3.1, Size=8B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 4.15 | |
| ImplicitModel Series=Llama3.1, Size=8B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 3.02 | |
| ImplicitModel Series=Llama3.1, Size=70B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 2.5 | |
| ImplicitModel Series=Qwen2.5, Size=7B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 1.51 |