Knowledge Acquisition on TOFU author-profile questions (held-out)
84.3Task AccuracyFINCH
Evaluation Results
| Method | Links | |
|---|---|---|
| FINCHModel=Llama-3-8B2026.05 | 84.3 | |
| SFTModel=Qwen3-4B2026.05 | 83.5 | |
| L2 RegModel=Qwen3-4B2026.05 | 83.5 | |
| FINCHModel=Qwen3-4B2026.05 | 83.3 | |
| SFTModel=Llama-3-8B2026.05 | 83.3 | |
| L2 RegModel=Llama-3-8B2026.05 | 82.8 | |
| WiSE-FTModel=Qwen3-4B2026.05 | 82.5 | |
| LoRAModel=Qwen3-4B2026.05 | 82.3 | |
| LoRAModel=Llama-3-8B2026.05 | 82 | |
| WiSE-FTModel=Llama-3-8B2026.05 | 80.8 | |
| FLOWModel=Qwen3-4B2026.05 | 77.5 | |
| FLOWModel=Llama-3-8B2026.05 | 76 | |
| SFT (small lr)Model=Llama-3-8B2026.05 | 69.5 | |
| SFT (small lr)Model=Qwen3-4B2026.05 | 65.8 | |
| TALRModel=Llama-3-8B2026.05 | 63.3 | |
| TALRModel=Qwen3-4B2026.05 | 62.5 | |
| DFTModel=Llama-3-8B2026.05 | 58.8 | |
| DFTModel=Qwen3-4B2026.05 | 55.8 | |
| STMModel=Qwen3-4B2026.05 | 53.8 | |
| BaseModel=Qwen3-4B2026.05 | 53.5 | |
| BaseModel=Llama-3-8B2026.05 | 52.8 | |
| STMModel=Llama-3-8B2026.05 | 50.8 |