Attribution faithfulness on LongRA
10.8Soft-NC ScoreHETA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| HETAModel=Phi-3-Medium-14B2026.04 | 10.8 | 2.35 | |
| HETAModel=GPT-J 6B2026.04 | 10.3 | 2.31 | |
| HETABackbone=Qwen2.5 3B2026.04 | 10.1 | 2.5 | |
| HETAModel=LLaMA-3.1 70B2026.04 | 9.9 | 2.6 | |
| Peering (PML)Model=Phi-3-Medium-14B2026.04 | 2.15 | 0.49 | |
| Peering (PML)Backbone=Qwen2.5 3B2026.04 | 2.05 | 0.61 | |
| Peering (PML)Model=GPT-J 6B2026.04 | 2.05 | 0.5 | |
| Integrated GradientsModel=Phi-3-Medium-14B2026.04 | 1.95 | 0.44 | |
| ContextCiteBackbone=Qwen2.5 3B2026.04 | 1.9 | 0.56 | |
| Integrated GradientsModel=GPT-J 6B2026.04 | 1.87 | 0.45 | |
| ReAgentModel=GPT-J 6B2026.04 | 1.68 | 0.37 | |
| ReAgentBackbone=Qwen2.5 3B2026.04 | 1.66 | 0.38 | |
| ReAgentModel=Phi-3-Medium-14B2026.04 | 1.66 | 0.38 | |
| ReAgentModel=LLaMA-3.1 70B2026.04 | 1.55 | 0.36 | |
| SEA-CoTModel=GPT-J 6B2026.04 | 1.54 | 0.32 | |
| SEA-CoTBackbone=Qwen2.5 3B2026.04 | 1.5 | 0.31 | |
| ContextCiteModel=Phi-3-Medium-14B2026.04 | 1.5 | 0.04 | |
| SEA-CoTModel=Phi-3-Medium-14B2026.04 | 1.5 | 0.31 | |
| ContextCiteModel=GPT-J 6B2026.04 | 1.42 | 0.03 | |
| Progressive InferenceModel=GPT-J 6B2026.04 | 1.35 | 0.28 | |
| SEA-CoTModel=LLaMA-3.1 70B2026.04 | 1.35 | 0.3 | |
| Progressive InferenceBackbone=Qwen2.5 3B2026.04 | 1.3 | 0.25 | |
| Progressive InferenceModel=Phi-3-Medium-14B2026.04 | 1.3 | 0.25 | |
| Integrated GradientsBackbone=Qwen2.5 3B2026.04 | 1.2 | 0.14 | |
| Progressive InferenceModel=LLaMA-3.1 70B2026.04 | 1.2 | 0.24 | |
| ContextCiteModel=LLaMA-3.1 70B2026.04 | 1.17 | 0.58 | |
| TDD-backwardModel=GPT-J 6B2026.04 | 1.1 | -0.12 | |
| TDD-backwardBackbone=Qwen2.5 3B2026.04 | 1.05 | -0.08 | |
| TDD-backwardModel=Phi-3-Medium-14B2026.04 | 1.05 | -0.1 | |
| fAMLModel=LLaMA-3.1 70B2026.04 | 0.46 | -0.21 | |
| Attention RolloutModel=GPT-J 6B2026.04 | 0.41 | -0.01 | |
| Attention RolloutModel=Phi-3-Medium-14B2026.04 | 0.39 | -0.02 | |
| Attention RolloutBackbone=Qwen2.5 3B2026.04 | 0.38 | -0.03 | |
| fAMLBackbone=Qwen2.5 3B2026.04 | 0.23 | -0.09 | |
| fAMLModel=Phi-3-Medium-14B2026.04 | 0.23 | -0.09 | |
| fAMLModel=GPT-J 6B2026.04 | 0.21 | -0.1 | |
| Peering (PML)Model=LLaMA-3.1 70B2026.04 | 0.15 | 0.15 | |
| Integrated GradientsModel=LLaMA-3.1 70B2026.04 | 0.13 | 0.13 | |
| TDD-backwardModel=LLaMA-3.1 70B2026.04 | -0.02 | -0.11 | |
| Attention RolloutModel=LLaMA-3.1 70B2026.04 | -1.48 | 0.01 |