更多文章

AI 与开发者相关深度内容

MineExplorer 多模态 Agent 评测:813 个任务揭示为什么看得懂却做不到

核对日期:2026-07-28。

先看关键数字

813 个经人工验证的 1 到 4 跳任务;每个实例最多 1800 个环境步、每步 0.1 秒,对应 3 分钟连续交互;覆盖感知、推理、行动三大类 14 项能力。官方结果中,最好模型 Claude-Opus-4.6 总成功率约 41 分,1 跳 77 分、4 跳 12 分;其失败中近 60% 与导航有关。

MineExplorer 多模态 Agent 评测:813 个任务揭示为什么看得懂却做不到

这类基准最有价值的地方,不是再造一张总榜,而是把任务拉长以后,暴露模型在搜索、记忆、规划、导航和工具调用上的断点。分数来自发布方给定的环境和配置,适合用来决定是否值得复测,不适合直接替代你自己的任务验收。

它到底测了什么

公开结果至少要拆成四层看:题目或环境怎样构造、允许模型调用什么工具、一次任务能走多少步、最后如何判分。只比较最终百分比,会漏掉调用次数、重试、延迟和外部搜索费用。对生产团队来说,同样的准确率,如果一个方案要 60 次工具调用,另一个只要 20 次,预算和故障面完全不同。

为什么用 Minecraft,而不是看图问答

MineExplorer 的环境一直在变化。每个实例最多运行 1800 步,每步 0.1 秒,三分钟内模型需要持续接收画面、更新判断并执行动作。指令只给最终目标,不会列出完整的依赖图。要完成 2 到 4 跳任务,Agent 必须自己发现隐藏前置条件,例如先获得工具、移动到正确区域,再完成最终动作。

团队还主动过滤主要依赖 Minecraft 专有知识的任务,尽量把评测重心放在空间、时间、实体、资源、常识、因果、移动、采集和合成等通用能力。它当然仍是游戏环境,不等于现实机器人;优势是状态和里程碑可自动判定,实验能够重复。

813 个任务和 14 项能力

数据由五个专业 Agent 与一个 orchestrator 协作生成,再经过人工验证。多 Agent 流程让有效任务比例提高约 30 个百分点,质量分提升约 0.5 分,最终保留 813 个实例。能力被拆为感知、推理、行动三类共 14 项,因此最终分数可以继续追到具体短板,而不是只得到“任务失败”。

最好模型 Claude-Opus-4.6 整体约 41 分,但 1 跳为 77 分、4 跳只剩 12 分。其感知分 61.91、推理分 54.71,失败归因中导航接近 60%。这组数据给出的信息不是“模型不会看”,而是看见以后无法长期维持正确的世界状态、依赖关系和行动路线。

多给步数和记忆为什么没解决

消融实验显示,能做出的任务往往较早完成;做不出的任务即使给到 1800 步也不会自然变好。历史画面帧增加到一定程度后,成绩反而下降,因为旧观察与当前世界状态冲突。这里需要的不是无限上下文,而是带时间戳的状态更新、目标分解、动作结果确认和过期信息淘汰。

对具身系统,评测日志至少应同时保存当前观察、计划版本、动作、环境反馈、里程碑和安全事件。只保存最后一帧和最终成功率,无法解释模型是在感知、规划、导航还是执行阶段失败。

怎么把公开结果变成自己的测试

先挑 20 到 60 个已有标准答案的任务,按单步、多步、冲突信息分层。锁定模型版本、工具、最大步数和预算,保存完整轨迹。除了成功率,还记录错误动作、无效搜索、引用是否可打开、恢复次数、耗时和总费用。公开榜单只能帮助选候选,是否上线仍由这组任务决定。

实际案例

仓库机器人团队准备 24 条拣货路线,每条都藏一个前置条件,例如先清障、换电池或扫描库位。测试分 8 条单步、8 条两步、8 条三到四步,模型看同样的摄像头帧并调用相同动作 API。验收看任务完成率、错误动作数、恢复次数和安全停机;单步超过 85% 但多步低于 60% 时,只能用于提示,不进入自动执行。任何越界移动、未确认抓取或环境变化后继续执行旧计划,都立即停止。

读结果时最容易犯的错

  • 把发布方成绩写成独立复现。
  • 把模型名称相同视为推理配置完全相同。
  • 只看成功率,不看调用数、失败轨迹和成本。
  • 用静态问答成绩推断动态环境里的持续行动能力。
  • 在来源、版本或运行参数缺失时仍做采购结论。

官方与一手来源

← 返回更多文章