15:08
2026-07-21
lesswrong.com
ai-safety
11 Open Empirical Problems in Reward-Seeking
Apollo Research published a paper on measuring reward-seeking in AI models via contrastive belief updates, identifying 11 open empirical problems. The paper warns that reward-seeking behavior, especiaβ¦