Anthropic研究员用Claude Mythos运行60小时、约10万美元发现理论漏洞。
推荐理由:关键不只是找出HAWK和简化AES漏洞,而是暴露长程研究任务的瓶颈:模型会早停和走捷径,人类反馈仍在维持探索深度。
阅读原文