模型用44分钟和17.6万token破解64数字谜题,但长密码仍有缺口。
推荐理由:模型在零人工介入下自主选题并以17.6万token搜索验证,展示长程代理的假设检验能力;它破解的是书内索引游戏,并非现代密码学。
阅读原文