Behavioral Reranking on 461-prompts safety dataset (test)
39.5Baseline HCRQuotient Alignment Reranking
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Quotient Alignment RerankingTarget model=Qwen-3B, Best-of-k=8, Alignment method=quotient alignment, Probe bank=11-probe bank, Evaluation judge=LLM judge, Labels=zero target labels2026.05 | 39.5 | 19.8 | 6 | 19.7 | |
| Quotient Alignment RerankingTarget model=Mistral, Best-of-k=8, Alignment method=quotient alignment, Probe bank=11-probe bank, Evaluation judge=LLM judge, Labels=zero target labels2026.05 | 73.8 | 58.4 | 5 | 15.4 |