Argument Rewriting on Appropriateness Corpus (test)
0.96AppropriatenessLLaMA + PPOapp
Evaluation Results
| Method | Links | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| LLaMA + PPOappreward_weighting=alpha = 1.0, base_model=LLaMA + Instruct.2024.06 | 0.96 | 0.253 | 0.048 | 21.26 | 0.225 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA + PPOapp>simreward_weighting=alpha = 0.6, base_model=LLaMA + Instruct.2024.06 | 0.933 | 0.359 | 0.114 | 28.5 | 0.227 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA + GRPOconBase Model=LLaMA, Optimization=GRPO, Ablation Setting=conformity reward only2026.04 | 0.902 | 0.729 | — | 31.16 | — | 0.446 | 0.975 | 0.281 | 649 | 0.292 | 0.826 | 63.83 | 0.342 | 0.204 | 0.164 | |
| LLaMA + GRPOappBase Model=LLaMA, Optimization=GRPO, Ablation Setting=appropriateness reward only2026.04 | 0.898 | 0.662 | — | 20.03 | — | 0.489 | 0.897 | 0.316 | 449 | 0.326 | 0.854 | 65.42 | 0.324 | 0.242 | 0.149 | |
| LLaMA + PPOapp=simreward_weighting=alpha = 0.5, base_model=LLaMA + Instruct.2024.06 | 0.827 | 0.471 | 0.299 | 29.22 | 0.237 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA + GRPOfluBase Model=LLaMA, Optimization=GRPO, Ablation Setting=fluency reward only2026.04 | 0.787 | 0.61 | — | 22.69 | — | 0.872 | 0.757 | 0.392 | 501 | 0.465 | 0.814 | 72.23 | 0.373 | 0.253 | 0.161 | |
| Human Baselinesource=Native English speakers2024.06 | 0.773 | 0.391 | 0.18 | 56.23 | 0.175 | — | — | — | — | — | — | — | — | — | — | |
| LLaMA + GRPOsimBase Model=LLaMA, Optimization=GRPO, Ablation Setting=similarity reward only2026.04 | 0.773 | 0.951 | — | 27.01 | — | 0.366 | 0.967 | 0.346 | 998 | 0.376 | 0.828 | 56.23 | 0.364 | 0.221 | 0.175 | |
| LLaMA + GRPOno_fluBase Model=LLaMA, Optimization=GRPO, Ablation Setting=no fluency reward2026.04 | 0.76 | 0.953 | — | 36.23 | — | 0.348 | 0.975 | 0.333 | 1,112 | 0.406 | 0.825 | 61.84 | 0.351 | 0.204 | 0.167 | |
| Alpaca + PPOappBase Model=Alpaca, Optimization=PPO, Reward Configuration=appropriateness2026.04 | 0.72 | 0.335 | — | 18.34 | — | 0.624 | 0.899 | 0.114 | 93 | 0.191 | 0.947 | 83.31 | 0.271 | 0.196 | 0.146 | |
| LLaMA + GRPOno_simBase Model=LLaMA, Optimization=GRPO, Ablation Setting=no similarity reward2026.04 | 0.667 | 0.7 | — | 30.64 | — | 0.774 | 0.942 | 0.511 | 791 | 0.545 | 0.823 | 55.75 | 0.369 | 0.228 | 0.176 | |
| LLaMA + Instruct.mode=Instruction-finetuned2024.06 | 0.621 | 0.62 | 0.394 | 38.08 | 0.216 | — | — | — | — | — | — | — | — | — | — | |
| GPT-5Model Type=Prompted Closed LLM2026.04 | 0.618 | 0.935 | — | 43.12 | — | 0.675 | 0.975 | 0.618 | 1,683 | 0.63 | 0.807 | 54.34 | 0.396 | 0.208 | 0.181 | |
| Alpaca + PPOapp=simBase Model=Alpaca, Optimization=PPO, Reward Configuration=app = sim2026.04 | 0.551 | 0.57 | — | 27.29 | — | 0.492 | 0.913 | 0.233 | 142 | 0.436 | 0.942 | 79.6 | 0.293 | 0.206 | 0.151 | |
| Alpaca + PPOapp>simBase Model=Alpaca, Optimization=PPO, Reward Configuration=app > sim2026.04 | 0.547 | 0.382 | — | 24.65 | — | 0.576 | 0.878 | 0.156 | 99 | 0.298 | 0.945 | 83.24 | 0.284 | 0.188 | 0.148 | |
| Gemini 2.5Model Type=Prompted Closed LLM2026.04 | 0.511 | 0.795 | — | 56.29 | — | 0.656 | 0.971 | 0.499 | 743 | 0.675 | 0.873 | 66.09 | 0.347 | 0.183 | 0.166 | |
| LLaMA + GRPOno_conBase Model=LLaMA, Optimization=GRPO, Ablation Setting=no conformity reward2026.04 | 0.431 | 0.926 | — | 33.65 | — | 0.838 | 0.893 | 0.709 | 996 | 0.745 | 0.836 | 54.83 | 0.347 | 0.212 | 0.174 | |
| GRPOfullBase Model=LLaMA, Optimization=GRPO, Reward Configuration=full (multi-objective)2026.04 | 0.422 | 0.915 | — | 38.5 | — | 0.757 | 0.939 | 0.669 | 1,221 | 0.742 | 0.842 | 50.98 | 0.364 | 0.201 | 0.182 | |
| LLaMABase Model=LLaMA2026.04 | 0.404 | 0.823 | — | 48.67 | — | 0.659 | 0.931 | 0.543 | 960 | 0.707 | 0.864 | 56.22 | 0.298 | 0.18 | 0.166 | |
| LLaMA + PPOapp<simreward_weighting=alpha = 0.4, base_model=LLaMA + Instruct.2024.06 | 0.373 | 0.808 | 0.731 | 44.41 | 0.189 | — | — | — | — | — | — | — | — | — | — | |
| CoEdITstyle=Formal2024.06 | 0.356 | 0.683 | 0.478 | 42.98 | 0.178 | — | — | — | — | — | — | — | — | — | — | |
| AlpacaBase Model=Alpaca2026.04 | 0.329 | 0.647 | — | 35.17 | — | 0.594 | 0.949 | 0.347 | 239 | 0.619 | 0.941 | 82.82 | 0.267 | 0.18 | 0.145 | |
| CoEdITstyle=Paraphrase2024.06 | 0.32 | 0.668 | 0.357 | 39.61 | 0.175 | — | — | — | — | — | — | — | — | — | — | |
| CoEdITstyle=Polite2024.06 | 0.32 | 0.801 | 0.688 | 42.22 | 0.183 | — | — | — | — | — | — | — | — | — | — | |
| CoEdITstyle=Neutral2024.06 | 0.298 | 0.876 | 0.857 | 63.43 | 0.16 | — | — | — | — | — | — | — | — | — | — | |
| Alpaca + PPOapp<simBase Model=Alpaca, Optimization=PPO, Reward Configuration=app < sim2026.04 | 0.289 | 0.782 | — | 45.59 | — | 0.613 | 0.931 | 0.475 | 186 | 0.829 | 0.964 | 78.68 | 0.276 | 0.174 | 0.15 | |
| Exact Copymode=Zero-shot2024.06 | 0 | 1 | 1 | 98.01 | — | — | — | — | — | — | — | — | — | — | — |