Privacy-related decision quality evaluation on MemPrivacy-Bench (test)
83.85GLM-5.1 ScoreMemPrivacy-4B-RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MemPrivacy-4B-RLModel Type=Privacy Model, Model Scale=4B, Training Protocol=RL2026.05 | 83.85 | 84.75 | 85.09 | |
| MemPrivacy-4B-SFTModel Type=Privacy Model, Model Scale=4B, Training Protocol=SFT2026.05 | 82.98 | 84.18 | 84.18 | |
| MemPrivacy-1.7B-RLModel Type=Privacy Model, Model Scale=1.7B, Training Protocol=RL2026.05 | 82.02 | 82.98 | 83.54 | |
| MemPrivacy-0.6B-RLModel Type=Privacy Model, Model Scale=0.6B, Training Protocol=RL2026.05 | 81.74 | 82.86 | 83.26 | |
| MemPrivacy-1.7B-SFTModel Type=Privacy Model, Model Scale=1.7B, Training Protocol=SFT2026.05 | 81.02 | 82.57 | 82.68 | |
| MemPrivacy-0.6B-SFTModel Type=Privacy Model, Model Scale=0.6B, Training Protocol=SFT2026.05 | 79.82 | 81.15 | 81.35 | |
| Gemini-3.1-ProModel Type=General Model2026.05 | 76.15 | 77.02 | 78.6 | |
| DeepSeek-V3.2-ThinkModel Type=General Model2026.05 | 70 | 72.07 | 73.02 | |
| GPT-5.2Model Type=General Model2026.05 | 66.54 | 67.94 | 69.3 | |
| GLM-5Model Type=General Model2026.05 | 65.38 | 66.92 | 68.39 | |
| Kimi-K2Model Type=General Model2026.05 | 63.01 | 65.48 | 67.15 |