Personalization Editing on UPQA balanced 100-sample
100Explicit AccuracyFT-M
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FT-Mmodel=deepseek-7b2025.12 | 100 | 100 | 80 | |
| GRACEmodel=deepseek-7b2025.12 | 100 | 0 | 1 | |
| LoRAmodel=deepseek-7b2025.12 | 100 | 78 | 40 | |
| ROMEmodel=deepseek-7b2025.12 | 100 | 1 | 1 | |
| FT-Mmodel=llama3-8b2025.12 | 100 | 99.67 | 95 | |
| GRACEmodel=llama3-8b2025.12 | 100 | 0 | 3 | |
| LoRAmodel=llama3-8b2025.12 | 100 | 99 | 89.67 | |
| FT-Mmodel=olmo2-7b2025.12 | 100 | 94 | 65 | |
| LoRAmodel=olmo2-7b2025.12 | 100 | 43 | 21 | |
| ROMEmodel=olmo2-7b2025.12 | 100 | 7.33 | 3 | |
| FT-Mmodel=qwen3-8b2025.12 | 100 | 96 | 95 | |
| GRACEmodel=qwen3-8b2025.12 | 100 | 1.67 | 5 | |
| LoRAmodel=qwen3-8b2025.12 | 100 | 82.67 | 54.33 | |
| ROMEmodel=qwen3-8b2025.12 | 100 | 4 | 3 | |
| ROMEmodel=llama3-8b2025.12 | 98 | 26 | 4 | |
| GRACEmodel=olmo2-7b2025.12 | 87.67 | 1 | 3.33 | |
| ICEmodel=llama3-8b2025.12 | 74 | 73 | 3 | |
| ICEmodel=olmo2-7b2025.12 | 63.33 | 74.33 | 3 | |
| FT-Lmodel=olmo2-7b2025.12 | 62 | 54.67 | 41.33 | |
| FT-Lmodel=qwen3-8b2025.12 | 43.33 | 46.67 | 48.67 | |
| FT-Lmodel=llama3-8b2025.12 | 38 | 39 | 36.33 | |
| FT-Lmodel=deepseek-7b2025.12 | 36 | 45.33 | 43 | |
| ICEmodel=qwen3-8b2025.12 | 29.67 | 80.33 | 5 | |
| ICEmodel=deepseek-7b2025.12 | 9.67 | 46.67 | 1 |