Loading the SOTA2 catalog…
SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability · SOTA2 Research