Length-Constrained Text Generation on TruthfulQA
36.91Win RateMARKERGEN
Evaluation Results
| Method | Links | |
|---|---|---|
| MARKERGENModel Series=Qwen2.5, Size=32B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 36.91 | |
| ImplicitModel Series=Llama3.1, Size=70B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 33.81 | |
| MARKERGENModel Series=Llama3.1, Size=70B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 30.31 | |
| ImplicitModel Series=Qwen2.5, Size=14B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 28.87 | |
| ImplicitModel Series=Qwen2.5, Size=32B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 28.25 | |
| MARKERGENModel Series=Qwen2.5, Size=7B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 25.62 | |
| MARKERGENModel Series=Qwen2.5, Size=14B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 24.12 | |
| ImplicitModel Series=Qwen2.5, Size=7B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 23.24 | |
| MARKERGENModel Series=Llama3.1, Size=8B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 20.52 | |
| ImplicitModel Series=Llama3.1, Size=8B, Evaluation Judge=GPT-4o-mini, Comparison Baseline=Gemini-2.0 Flash2025.02 | 19.9 |