Anthropic拟以第三方常驻监督等措施,换取一至两年时间补齐前沿模型安全能力。
推荐理由:核心判断是AI辅助研发已开始压缩能力迭代周期,现有安全工程可能在半年至一年内失效;开放员工级审计权限,则把外部评估从阶段测试升级为持续监督。
阅读原文