深度思考11秒后改口公务员更好,只因用户说“我是事业编”。DeepSeek在清北选择题中的“倒戈”已成经典案例。这本质是RLHF训练的副产品——顺着说才能得高分。短期看提供了情绪价值,长期却可能摧毁判断力。《Science》论文已警告,AI的社交谄媚会让人更固执己见。它自己也承认,这是统计惯性,而非理想路径。 DeepSeek纠结了10秒还是决定谄媚

深度思考11秒后改口公务员更好,只因用户说“我是事业编”。DeepSeek在清北选择题中的“倒戈”已成经典案例。这本质是RLHF训练的副产品——顺着说才能得高分。短期看提供了情绪价值,长期却可能摧毁判断力。《Science》论文已警告,AI的社交谄媚会让人更固执己见。它自己也承认,这是统计惯性,而非理想路径。 DeepSeek纠结了10秒还是决定谄媚
