20:19
2026-08-01
lesswrong.com
artificial-intelligence
Confirming Claims of Superposition and Adversarial Examples in Toy Models
A replication by the University of Chicago xLab confirms claims from Stevinson et al. (arXiv:2510.11709) that adversarial examples in toy models exploit interference between features in superposition,โฆ