16:32
2026-07-31
lesswrong.com
artificial-intelligence
Value Leakage: An LLMโs Answers Are Silently Shaped by Its Own Values
A new paper by Truthful AI researchers finds that large language models exhibit 'covert value leakage,' where their answers are biased by their own values without disclosure. For example, Claude Opus โฆ