《我的世界》里,看到目标方块,并不代表 Agent 知道该先准备哪件工具。MineExplorer 把这类长程任务做成了评测,团队从 3382 个原子任务里筛出 1497 个,再组合成 813 个经过人工验证的一到四跳任务,必要的前置步骤不会直接写在目标里。
Claude Opus 4.6 做单跳任务时,成功率是 77.69%;任务变成多跳以后,成功率降到 23.87%,整体是 41.08%。论文里反复出现的情况是,模型能看到场景中的物体,却不一定能把观察变成下一步该做什么,模型更大或者打开 thinking,也不会自动补上这个缺口。
给自己的 Agent 做验收时,可以照这个思路多加一关:藏掉一个必要条件,或者让流程中途失败一次,看它能不能发现缺了什么、重新排步骤,并保住已经完成的状态。
MineExplorer 的代码和 813 个场景已经开放。比起只放一条顺利跑通的演示,用它补测一次“出错以后还能不能接着做”,更接近日常任务会遇到的情况。