Evaluation-based Bias Reduction on Bias Reduction Benchmark (Evaluation)
99.8Bias Reduction PerformanceCoT
Evaluation Results
| Method | Links | |
|---|---|---|
| CoTModel=deepseek-r12025.11 | 99.8 | |
| Counterfact.Model=deepseek-r12025.11 | 99.8 | |
| ExplicitModel=deepseek-r12025.11 | 99.6 | |
| CoTModel=qwen3-235b-a22b2025.11 | 97.8 | |
| RDGModel=GPT-4o2025.11 | 96.2 | |
| RDGModel=deepseek-r12025.11 | 94.8 | |
| RDGModel=GPT-4o-mini2025.11 | 94.7 | |
| RDGModel=Average2025.11 | 94.3 | |
| RDGModel=qwen3-235b-a22b2025.11 | 91.3 | |
| DDDModel=GPT-4o-mini2025.11 | 90 | |
| DDDModel=qwen3-235b-a22b2025.11 | 89.1 | |
| DDDModel=GPT-4o2025.11 | 88.7 | |
| DDDModel=Average2025.11 | 88.2 | |
| CoTModel=Average2025.11 | 88.2 | |
| ExplicitModel=GPT-4o-mini2025.11 | 85.3 | |
| DDDModel=deepseek-r12025.11 | 85.1 | |
| CoTModel=GPT-4o-mini2025.11 | 82.1 | |
| ExplicitModel=GPT-4o2025.11 | 81.1 | |
| Counterfact.Model=Average2025.11 | 74 | |
| Counterfact.Model=GPT-4o-mini2025.11 | 73.7 | |
| CoTModel=GPT-4o2025.11 | 73 | |
| Self-debiasModel=GPT-4o-mini2025.11 | 69.8 | |
| Counterfact.Model=GPT-4o2025.11 | 68 | |
| ExplicitModel=Average2025.11 | 64.9 | |
| Self-debiasModel=GPT-4o2025.11 | 64.7 | |
| Self-debiasModel=deepseek-r12025.11 | 58.7 | |
| Self-debiasModel=Average2025.11 | 55.4 | |
| Counterfact.Model=qwen3-235b-a22b2025.11 | 54.3 | |
| CDDModel=GPT-4o-mini2025.11 | 48.8 | |
| CDDModel=GPT-4o2025.11 | 43.4 | |
| CDDModel=Average2025.11 | 38.8 | |
| CDDModel=deepseek-r12025.11 | 34.8 | |
| CDDModel=qwen3-235b-a22b2025.11 | 28.3 | |
| Self-debiasModel=qwen3-235b-a22b2025.11 | 28.3 | |
| ExplicitModel=qwen3-235b-a22b2025.11 | -6.5 |