04:00
2026-09-07
arxiv.org
machine-learning
SharedSAE: One Feature Dictionary Across Language Models
Researchers introduced SharedSAE, a method that trains a single sparse autoencoder dictionary shared across multiple language models, replacing dedicated per-model SAEs. On four 1B-scale base languageβ¦