04:14
2026-07-27
lesswrong.com
machine-learning
You don't need error nodes, you need better features
A new training method called replacement-aware training produces sparse auto-encoders (SAEs) that retain language capabilities when used in a full replacement model of Gemma-2-2B, unlike standard SAEsβ¦