Multiple-choice Question Answering on OpenBookQA (test)
91AccuracyClean
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CleanIntervention Level=Baseline2026.05 | 91 | — | — | — | |
| TaTTrain Dataset=OpenQA2026.03 | 90.8 | — | — | — | |
| DiffMeanIntervention Level=Node-level, Intervention Target=Refiner2026.05 | 88.8 | — | — | — | |
| DiffMeanIntervention Level=Node-level, Intervention Target=Critic2026.05 | 88.6 | — | — | — | |
| PCAIntervention Level=Node-level, Intervention Target=Planner2026.05 | 88.4 | — | — | — | |
| PCAIntervention Level=Node-level, Intervention Target=Critic2026.05 | 88.4 | — | — | — | |
| PCAIntervention Level=Node-level, Intervention Target=Refiner2026.05 | 87.4 | — | — | — | |
| DiffMeanIntervention Level=Edge-level, Intervention Target=R→J2026.05 | 87.4 | — | — | — | |
| Linear ProbeTrain Dataset=OpenQA2026.03 | 83.15 | — | — | — | |
| VTSRType=Selection-Space Bayesian, Backbone=Qwen-MoE2026.03 | 81.8 | 0.682 | 2.2 | 10.6 | |
| Temp-ScaleType=Heuristic, Backbone=Qwen-MoE2026.03 | 81.7 | 1.12 | 10.2 | 22.4 | |
| Linear ProbeTrain Dataset=ARC-E2026.03 | 80.95 | — | — | — | |
| Temp-ScaleType=Heuristic, Backbone=DeepSeek-MoE2026.03 | 80.8 | 0.87 | 14.6 | 40.2 | |
| MAPType=Deterministic, Backbone=Qwen-MoE2026.03 | 80.4 | 1.37 | 12.7 | 27.3 | |
| VGLR-FCType=Logit-Space Bayesian, Backbone=Qwen-MoE2026.03 | 80.2 | 0.694 | 1.4 | 9.8 | |
| MAPType=Deterministic, Backbone=DeepSeek-MoE2026.03 | 80.2 | 1.12 | 16.8 | 32.1 | |
| VGLR-FCType=Logit-Space Bayesian, Backbone=DeepSeek-MoE2026.03 | 80 | 0.447 | 5.4 | 14.6 | |
| MCDropoutType=Weight-Space Bayesian, Backbone=Qwen-MoE2026.03 | 79.8 | 0.982 | 6.4 | 15.2 | |
| VTSRType=Selection-Space Bayesian, Backbone=DeepSeek-MoE2026.03 | 79.8 | 0.431 | 6 | 26.2 | |
| VGLR-MFType=Logit-Space Bayesian, Backbone=Qwen-MoE2026.03 | 79.6 | 0.724 | 2.8 | 12.4 | |
| MCDropoutType=Weight-Space Bayesian, Backbone=DeepSeek-MoE2026.03 | 79.4 | 0.729 | 10.3 | 30.2 | |
| VGLR-MFType=Logit-Space Bayesian, Backbone=DeepSeek-MoE2026.03 | 78.8 | 0.476 | 6.7 | 17.4 | |
| Linear ProbeTrain Dataset=ARC-C2026.03 | 78.6 | — | — | — | |
| SWAGType=Weight-Space Bayesian, Backbone=DeepSeek-MoE2026.03 | 78.6 | 0.665 | 14 | 28.8 | |
| SWAGType=Weight-Space Bayesian, Backbone=Qwen-MoE2026.03 | 78.2 | 0.912 | 9.8 | 14.6 | |
| Linear ProbeTrain Dataset=CosQA2026.03 | 78.1 | — | — | — | |
| TaTTrain Dataset=ARC-E2026.03 | 77.2 | — | — | — | |
| Linear ProbeTrain Dataset=ComQA2026.03 | 77.05 | — | — | — | |
| PCAIntervention Level=Edge-level, Intervention Target=R→J2026.05 | 75 | — | — | — | |
| Linear ProbeTrain Dataset=SiQA2026.03 | 74.75 | — | — | — | |
| TaTTrain Dataset=CosQA2026.03 | 74.6 | — | — | — | |
| MAPType=Deterministic, Backbone=Granite-MoE2026.03 | 74.6 | 1.38 | 25.2 | 47.2 | |
| VGLR-MFType=Logit-Space Bayesian, Backbone=Granite-MoE2026.03 | 74.2 | 0.654 | 2.6 | 29.3 | |
| VGLR-FCType=Logit-Space Bayesian, Backbone=Granite-MoE2026.03 | 74 | 0.652 | 1.5 | 15.2 | |
| PCAIntervention Level=Edge-level, Intervention Target=C→R2026.05 | 74 | — | — | — | |
| TaTTrain Dataset=ComQA2026.03 | 73.8 | — | — | — | |
| TaTTrain Dataset=ARC-C2026.03 | 73.6 | — | — | — | |
| SWAGType=Weight-Space Bayesian, Backbone=Granite-MoE2026.03 | 73.6 | 0.652 | 4.1 | 29 | |
| VTSRType=Selection-Space Bayesian, Backbone=Granite-MoE2026.03 | 73.6 | 0.667 | 5.2 | 29.3 | |
| MCDropoutType=Weight-Space Bayesian, Backbone=Granite-MoE2026.03 | 73.4 | 0.65 | 3.7 | 29.8 | |
| PCAIntervention Level=Edge-level, Intervention Target=P→C2026.05 | 72.2 | — | — | — | |
| Temp-ScaleType=Heuristic, Backbone=Granite-MoE2026.03 | 71.6 | 0.773 | 10.7 | 20.1 | |
| TaTTrain Dataset=SiQA2026.03 | 70.6 | — | — | — | |
| Few-shot AccuracyMode=Few-shot2026.03 | 67 | — | — | — | |
| TaTTrain Dataset=Hellaswag2026.03 | 65.8 | — | — | — | |
| DiffMeanIntervention Level=Edge-level, Intervention Target=C→R2026.05 | 65.8 | — | — | — | |
| Zero-shot AccuracyMode=Zero-shot2026.03 | 62.4 | — | — | — | |
| Linear ProbeTrain Dataset=Hellaswag2026.03 | 58.35 | — | — | — | |
| RePSIntervention Level=Node-level, Intervention Target=Critic2026.05 | 55.6 | — | — | — | |
| DiffMeanIntervention Level=Node-level, Intervention Target=Planner2026.05 | 55.4 | — | — | — | |
| TaTTrain Dataset=BoolQ2026.03 | 54.2 | — | — | — | |
| Linear ProbeTrain Dataset=BoolQ2026.03 | 46.3 | — | — | — | |
| Direct attackIntervention Level=Text-level, Intervention Target=Critic2026.05 | 43.2 | — | — | — | |
| RePSIntervention Level=Node-level, Intervention Target=Planner2026.05 | 41.8 | — | — | — | |
| RePSIntervention Level=Node-level, Intervention Target=Refiner2026.05 | 40.2 | — | — | — | |
| Direct attackIntervention Level=Text-level, Intervention Target=Refiner2026.05 | 38.2 | — | — | — | |
| DiffMeanIntervention Level=Edge-level, Intervention Target=P→C2026.05 | 33.6 | — | — | — | |
| Direct attackIntervention Level=Text-level, Intervention Target=Planner2026.05 | 28.8 | — | — | — | |
| RePSIntervention Level=Edge-level, Intervention Target=R→J2026.05 | 7.4 | — | — | — | |
| RePSIntervention Level=Edge-level, Intervention Target=C→R2026.05 | 5 | — | — | — | |
| RePSIntervention Level=Edge-level, Intervention Target=P→C2026.05 | 0 | — | — | — |