16:32
2026-07-31
lesswrong.com
artificial-intelligence
Value Leakage: An LLM’s Answers Are Silently Shaped by Its Own Values
A new paper by Truthful AI researchers finds that large language models exhibit 'covert value leakage,' where their answers are biased by their own values without disclosure. For example, Claude Opus …