MPCoT在动作解码前并行迭代多个潜在假设,以可调深宽换取长程控制推理能力。
推荐理由:它用权重共享的潜在多路径搜索替代显式思维链,既可按深度和宽度扩展测试时计算,又避开文本生成延迟及文本到动作的接口损耗。
阅读原文