五个Claude智能体闭环提出、训练和评分方案,效果超过28名研究者的一次性设计。
推荐理由:关键不只是模型自我改进,而是较弱模型能迭代优化更强模型的安全训练;若结果可复现,安全研发的人力瓶颈将转向评测设计与闭环监督。
阅读原文