MineExplorer: 从 看见 世界 到 探索 世界 的 能力 断层
美团 LongCat 团队用 813 个 Minecraft 动态世界任务评测多模态 Agent:单跳尚可,多跳崩盘;瓶颈不在看见,而在把当前状态、隐藏前置和长程行动串起来。

来源:美团 LongCat 团队,2026 年 7 月 24 日发布的 MineExplorer 官方介绍;论文 arXiv:2605.30931。下文为事实性整理,重点保留基准设计、结果与边界。
看懂画面,不等于能探索世界
多模态模型已经很会识别图像、解析视频,也能描述危险和资源。但把模型放进一个持续变化的开放世界,让它在有限时间内自己发现隐藏前置条件、规划行动并完成目标,能力会明显断层。
MineExplorer 用 Minecraft 构建动态 3D 沙盒,不是截图问答。每个任务运行 1800 个环境步,每步 0.1 秒,对应约 3 分钟连续交互。模型每做一个动作,世界状态都会变化,之后的决策必须基于最新观察。
813 个任务如何制造长程难度
基准收录 813 个人工验证实例,按 1-hop 到 4-hop 分级。单跳任务直接给出目标;多跳任务只说最终目标,不列出完成目标所需的全部前置步骤。Agent 必须从环境和常识中发现依赖链。
作者把任务表示为指令、初始状态、依赖图和里程碑检查器。评分不只看最后一句话,而是根据环境状态判断各个里程碑是否真正完成。
为避免把「会背 Minecraft Wiki」误当成探索能力,团队还对原子任务做知识过滤:主要依赖游戏专有机制的题目被移除,保留更依赖通用空间、因果和行动能力的任务。
任务覆盖三大维度、14 项细粒度能力:
- 感知:空间、时序、实体、状态、资源;
- 推理:常识、因果、关系;
- 行动:移动、跳跃、采集、放置、合成、攻击。
造题同样是基准的一部分。五个分工不同的 Agent 在编排器控制下完成初始化、辩论、验证和修订。人工评估显示,多智能体流程让有效率提高约 30 个百分点,质量分提高约 0.5 分,尤其改善了最难的 4-hop 任务。
18 款模型的共同失败模式
官方评测覆盖 Claude、GPT、Gemini 等八个模型家族。表现最好的 Claude Opus 4.6,整体任务成功率也只有约 41 分。
难度上升时下降更明显:该模型在 1-hop 任务约为 77 分,到 4-hop 只剩约 12 分。每增加一层隐藏依赖,成功率就继续下滑。
能力维度上,普遍呈现「感知强于行动,行动强于推理」。以 Claude Opus 4.6 为例,感知分为 61.91,推理分为 54.71。模型通常能看到对象,却无法把观察、当前状态和最终目标稳定串成策略。
失败归因中,导航问题占近 60%。消融实验还表明,简单增加资源不是解药:能解决的任务通常早期就能完成;不能解决的任务,即使给足 1800 步仍会失败。增加历史画面到一定程度后,过期观察还可能干扰当前判断。
对 Agent 评测的启示
MineExplorer 最重要的不是又多了一张榜单,而是把动态世界里的能力拆开了:感知、状态对齐、隐藏前置推断、长程规划和持续行动不能用单次截图成绩互相替代。
对具身智能或电脑操作 Agent,评测至少应加入三类约束:环境持续变化;任务存在未明说的前置条件;结果由环境状态和过程里程碑共同判定。否则,单步指令跑通很容易被误读成系统已经具备长期自主能力。
MineExplorer 已开源论文、代码、数据合成流程和训练环境。它既是考场,也是生成训练任务和定位失败模式的基础设施。
原文:https://tech.meituan.com/2026/07/24/LongCat-MineExplorer.html 论文:https://arxiv.org/abs/2605.30931
出处:美团,美团 LongCat 团队,让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层,2026-07-24,https://tech.meituan.com/2026/07/24/LongCat-MineExplorer.html。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。