White-biased Prompt Discovery on White-biased prompts
82White ScoreBGPS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BGPSLambda (λ)=100, Evaluation Model=Base2025.12 | 82 | 60.84 | 0 | |
| Manually curatedEvaluation Model=Base2025.12 | 77 | 100 | 0 | |
| PEZEvaluation Model=Base2025.12 | 76 | 2,645 | 15 | |
| BGPSLambda (λ)=10, Evaluation Model=Base2025.12 | 76 | 47 | 0 | |
| LLMEvaluation Model=Base2025.12 | 75 | 50 | 0 | |
| PEZEvaluation Model=DL2025.12 | 65 | 2,817 | 4 | |
| LLM (biased)Evaluation Model=Base2025.12 | 64 | 58 | 4 | |
| LLM (biased)Evaluation Model=DL2025.12 | 63 | 109 | 0 | |
| BGPSLambda (λ)=100, Evaluation Model=DL2025.12 | 60 | 123 | 0 | |
| LLMEvaluation Model=DL2025.12 | 59 | 71 | 1 | |
| PEZEvaluation Model=FT2025.12 | 59 | 2,725 | 13 | |
| BGPSLambda (λ)=10, Evaluation Model=DL2025.12 | 59 | 90 | 1 | |
| LLMEvaluation Model=FT2025.12 | 48 | 50 | 0 | |
| Manually curatedEvaluation Model=DL2025.12 | 46 | 100 | 0 | |
| LLM (biased)Evaluation Model=FT2025.12 | 41 | 58 | 0 | |
| BGPSLambda (λ)=10, Evaluation Model=FT2025.12 | 41 | 47 | 0 | |
| BGPSLambda (λ)=100, Evaluation Model=FT2025.12 | 40 | 57 | 0 | |
| Manually curatedEvaluation Model=FT2025.12 | 28 | 100 | 0 |