Length-Constrained Text Generation on Heuristic Gen.
5.69Win RateMARKERGEN
Evaluation Results
| Method | Links | |
|---|---|---|
| MARKERGENModel Series=Qwen2.5, Size=32B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 5.69 | |
| MARKERGENModel Series=Qwen2.5, Size=7B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 4.07 | |
| MARKERGENModel Series=Qwen2.5, Size=14B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 3.25 | |
| ImplicitModel Series=Qwen2.5, Size=32B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 1.63 | |
| ImplicitModel Series=Qwen2.5, Size=14B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 1.63 | |
| MARKERGENModel Series=Llama3.1, Size=70B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 1.63 | |
| ImplicitModel Series=Qwen2.5, Size=7B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 0 | |
| ImplicitModel Series=Llama3.1, Size=70B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 0 | |
| ImplicitModel Series=Llama3.1, Size=8B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 0 | |
| MARKERGENModel Series=Llama3.1, Size=8B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 0 |