Token Attribution Faithfulness on Known 1000
5.6DistanceDual Path Attribution (DPA)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Dual Path Attribution (DPA)Backbone model=Llama-2-7B-Chat2026.03 | 5.6 | 34.41 | 28.81 | — | |
| MeanBackbone model=Llama-2-7B-Chat2026.03 | 5.97 | 25.1 | 19.13 | — | |
| DePassBase Model=Qwen3-4B-Instruct-2507, Method category=Decomposition-based2026.03 | 6.24 | 26.74 | 20.5 | — | |
| Last layerBackbone model=Llama-2-7B-Chat2026.03 | 6.53 | 28.85 | 22.32 | — | |
| Dual Path Attribution (DPA)Base Model=Qwen3-4B-Instruct-2507, Method category=Proposed Method2026.03 | 6.54 | 22.37 | 15.83 | — | |
| Dual Path Attribution (DPA)Model=Mistral-7B-Instruct-v0.32026.03 | 7.16 | 43.23 | 36.07 | — | |
| DePassBackbone model=Llama-2-7B-Chat2026.03 | 7.55 | 26.29 | 18.74 | — | |
| Integrated GradientsBase Model=Qwen3-4B-Instruct-2507, Method category=Gradient-based2026.03 | 7.55 | 16.18 | 8.63 | — | |
| Last layerModel=Mistral-7B-Instruct-v0.32026.03 | 7.8 | 30.41 | 22.61 | — | |
| Last layerBase Model=Qwen3-4B-Instruct-2507, Method category=Attention-based2026.03 | 8.03 | 22.82 | 14.79 | — | |
| MeanModel=Mistral-7B-Instruct-v0.32026.03 | 8.61 | 32.27 | 23.66 | — | |
| MeanBase Model=Qwen3-4B-Instruct-2507, Method category=Attention-based2026.03 | 9.5 | 22.35 | 12.85 | — | |
| DePassModel=Mistral-7B-Instruct-v0.32026.03 | 9.64 | 37.53 | 27.89 | — | |
| Integrated GradientsModel=Mistral-7B-Instruct-v0.32026.03 | 9.72 | 38.14 | 28.42 | — | |
| Dual Path Attribution (DPA)Model=Qwen2.5-32B-Instruct2026.03 | 10.32 | — | 31.03 | 41.35 | |
| Input×GradientBase Model=Qwen3-4B-Instruct-2507, Method category=Gradient-based2026.03 | 10.54 | 17.95 | 7.41 | — | |
| Last layerModel=Qwen2.5-32B-Instruct, Category=Attention-based2026.03 | 10.63 | — | 21.55 | 32.18 | |
| GradientBase Model=Qwen3-4B-Instruct-2507, Method category=Gradient-based2026.03 | 10.88 | 18.07 | 7.19 | — | |
| Input×GradientBackbone model=Llama-2-7B-Chat2026.03 | 11.31 | 20.31 | 9 | — | |
| RandomBase Model=Qwen3-4B-Instruct-2507, Method category=Reference2026.03 | 11.52 | 19.64 | 8.12 | — | |
| Integrated GradientsBackbone model=Llama-2-7B-Chat2026.03 | 11.58 | 25.3 | 13.72 | — | |
| MeanModel=Qwen2.5-32B-Instruct, Category=Attention-based2026.03 | 12.06 | — | 21.01 | 33.07 | |
| GradientBackbone model=Llama-2-7B-Chat2026.03 | 12.14 | 18.75 | 6.61 | — | |
| DePassModel=Qwen2.5-32B-Instruct, Category=Decomposition-based2026.03 | 12.29 | — | 8.24 | 20.53 | |
| RandomBackbone model=Llama-2-7B-Chat2026.03 | 13.17 | 20.64 | 7.47 | — | |
| IFRBackbone model=Llama-2-7B-Chat2026.03 | 15.22 | 12.76 | -2.46 | — | |
| RolloutBase Model=Qwen3-4B-Instruct-2507, Method category=Attention-based2026.03 | 15.25 | 11.79 | -3.46 | — | |
| RolloutBackbone model=Llama-2-7B-Chat2026.03 | 15.45 | 16.17 | 0.72 | — | |
| IFRBase Model=Qwen3-4B-Instruct-2507, Method category=Contextual mixing-based2026.03 | 15.8 | 11.28 | -4.52 | — | |
| Input×GradientModel=Mistral-7B-Instruct-v0.32026.03 | 16.31 | 28.18 | 11.87 | — | |
| GradientModel=Mistral-7B-Instruct-v0.32026.03 | 17.31 | 24.66 | 7.35 | — | |
| Integrated GradientsModel=Qwen2.5-32B-Instruct, Category=Gradient-based2026.03 | 18.6 | — | 9.1 | 27.7 | |
| IFRModel=Qwen2.5-32B-Instruct, Category=Contextual mixing-based2026.03 | 18.75 | — | 7.86 | 26.61 | |
| GradientModel=Qwen2.5-32B-Instruct, Category=Gradient-based2026.03 | 19.44 | — | 7.23 | 26.67 | |
| RandomModel=Mistral-7B-Instruct-v0.32026.03 | 19.67 | 26.38 | 6.71 | — | |
| RolloutModel=Qwen2.5-32B-Instruct, Category=Attention-based2026.03 | 19.7 | — | -8.33 | 11.37 | |
| RolloutModel=Mistral-7B-Instruct-v0.32026.03 | 19.79 | 20.46 | 0.67 | — | |
| RandomModel=Qwen2.5-32B-Instruct2026.03 | 20 | — | 9.79 | 29.79 | |
| Input × GradientModel=Qwen2.5-32B-Instruct, Category=Gradient-based2026.03 | 21.52 | — | 5.4 | 26.92 | |
| IFRModel=Mistral-7B-Instruct-v0.32026.03 | 21.97 | 16.43 | -5.54 | — |