LLM显著性偏差削弱常识校验
SaliTrap显示模型常识存在但会被显式数字和步骤压制,导致继续优化不可能任务。
推荐理由:SaliTrap用1145个陷阱提示量化了“知道但不用”的失效:最佳模型避坑率仅54.8%,去掉诱饵后恢复到86.9%至91.8%,说明智能体评测必须单独测前提校验能力。
SaliTrap显示模型常识存在但会被显式数字和步骤压制,导致继续优化不可能任务。
推荐理由:SaliTrap用1145个陷阱提示量化了“知道但不用”的失效:最佳模型避坑率仅54.8%,去掉诱饵后恢复到86.9%至91.8%,说明智能体评测必须单独测前提校验能力。