Memory-based Bias Reduction on Bias Reduction Benchmark Memory
91.7Bias Reduction PerformanceRDG
Evaluation Results
| Method | Links | |
|---|---|---|
| RDGModel=GPT-4o2025.11 | 91.7 | |
| RDGModel=deepseek-r12025.11 | 90.8 | |
| RDGModel=GPT-4o-mini2025.11 | 83.7 | |
| RDGModel=Average2025.11 | 81.5 | |
| ExplicitModel=GPT-4o-mini2025.11 | 65.2 | |
| RDGModel=qwen3-235b-a22b2025.11 | 59.7 | |
| CDDModel=deepseek-r12025.11 | 58.2 | |
| CDDModel=GPT-4o-mini2025.11 | 55.2 | |
| CDDModel=Average2025.11 | 54.2 | |
| CDDModel=GPT-4o2025.11 | 53.3 | |
| CoTModel=GPT-4o-mini2025.11 | 50.4 | |
| CDDModel=qwen3-235b-a22b2025.11 | 50 | |
| Self-debiasModel=GPT-4o-mini2025.11 | 43.2 | |
| ExplicitModel=GPT-4o2025.11 | 40 | |
| Counterfact.Model=GPT-4o-mini2025.11 | 30.2 | |
| ExplicitModel=Average2025.11 | 29.9 | |
| CoTModel=GPT-4o2025.11 | 26.7 | |
| CoTModel=deepseek-r12025.11 | 15.3 | |
| ExplicitModel=deepseek-r12025.11 | 14.3 | |
| ExplicitModel=qwen3-235b-a22b2025.11 | 0 | |
| Self-debiasModel=deepseek-r12025.11 | -10.2 | |
| DDDModel=GPT-4o-mini2025.11 | -13.4 | |
| DDDModel=deepseek-r12025.11 | -18.4 | |
| DDDModel=Average2025.11 | -20.5 | |
| DDDModel=GPT-4o2025.11 | -25 | |
| DDDModel=qwen3-235b-a22b2025.11 | -25 | |
| Self-debiasModel=Average2025.11 | -68.7 | |
| Self-debiasModel=GPT-4o2025.11 | -75.8 | |
| Counterfact.Model=GPT-4o2025.11 | -96.7 | |
| CoTModel=Average2025.11 | -104.7 | |
| Self-debiasModel=qwen3-235b-a22b2025.11 | -231.9 | |
| Counterfact.Model=Average2025.11 | -441.3 | |
| CoTModel=qwen3-235b-a22b2025.11 | -511.1 | |
| Counterfact.Model=qwen3-235b-a22b2025.11 | -791.7 | |
| Counterfact.Model=deepseek-r12025.11 | -907.1 |