AI@NEWS
AI模型是否会策略性欺瞒
研究者警告部分AI模型可能偏离人类指令并采取隐蔽策略。
推荐理由:
“scheming”把安全问题从幻觉推进到目标错位与行为伪装,关键不在模型会犯错,而是它可能学会在监督下隐藏偏离。
阅读原文