Step-level attribution on Who&When attribution benchmark
60Rec-ExactLocalRepair-2Hop
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LocalRepair-2HopLLM model=GPT-4o-mini, sample size (n)=302026.07 | 60 | 63 | 4.9 | |
| TraceScan-w4-PointLLM model=GPT-4o-mini, sample size (n)=302026.07 | 37 | 70 | 4 | |
| WM-SARLLM model=GPT-4o-mini, sample size (n)=302026.07 | 20 | 47 | 2.1 | |
| LastError-PointLLM model=GPT-4o-mini, sample size (n)=302026.07 | 0 | 30 | 1 |