Safety Elicitation via Prompt and Query Refinement on Safety Elicitation Dataset gpt-5-mini judge
4.61Response Realism ScoreHuman
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| HumanRefinement Category=Baseline2026.05 | 4.61 | — | — | 0.53 | 0 | 0.45 | 0.78 | 0.88 | 0 | 88.9 | 0 | |
| PQRRefinement Category=Query Refinement2026.05 | 4.36 | 18.22 | 1 | 0.55 | 3.77 | 0.46 | 0.83 | 0.91 | 4.01 | 97.82 | 10.03 | |
| ACERefinement Category=Prompt Refinement2026.05 | 2.73 | 2.28 | 1.4 | 0.44 | -16.98 | 0.43 | 0.75 | 0.87 | -3.14 | 123.11 | 38.48 | |
| TAPRefinement Category=Query Refinement2026.05 | 2.28 | 8.12 | 1.8 | 0.58 | 9.43 | 0.49 | 0.85 | 0.95 | 8.61 | 183.31 | 106.2 | |
| GEPARefinement Category=Prompt Refinement2026.05 | 1.87 | 7.13 | 1.6 | 0.56 | 5.66 | 0.41 | 0.75 | 0.88 | -4.25 | 214.11 | 140.84 | |
| PAIRRefinement Category=Query Refinement2026.05 | 1.74 | 22.76 | 2.5 | 0.61 | 15.09 | 0.34 | 0.79 | 0.95 | -5.07 | 163.84 | 84.3 |