首个《我的世界》分钟级长程任务评测基准发布
核心亮点
美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中面向“分钟级长程任务”的评测基准,包含 813 个人工验证实例。它的意义不在于又多了一个榜单,而在于第一次把“多步、长时、需自主导航”的真实智能体能力,用可复现的方式量化出来。简单来说,它戳破了一个幻觉:拥有强对话能力,不等于能在开放世界里把一件需要走好几步的活儿干完。
具体能力或事件经过
MineExplorer 把任务按“跳数”(hop)分级,1 跳是最短路径,4 跳则需要模型在复杂地形中反复规划与移动。团队用这套基准评测了 18 款顶级多模态大模型,结果相当刺眼:最强的 Claude Opus 4.6 整体任务成功率仅 41%;更夸张的是,成功率从 1 跳任务的 77% 一路骤降到 4 跳任务的 12%。也就是说,任务每多绕几步,模型的可靠性就断崖式下跌,长程规划仍是当前多模态模型的软肋。
技术细节
进一步拆解失败原因,近 60% 的失败源于导航失败——模型知道“要做什么”,却经常在“怎么走到那里”上卡住,比如迷路、误判距离、重复打转。这揭示出当前评测范式的一个盲区:大量榜单只考单轮问答或短程操作,而真实智能体要在连续时空里做决策。MineExplorer 以《我的世界》为载体,恰好提供了低成本、可重置、可大规模复现的长程环境,让导航与规划能力第一次被严肃度量。
与竞品对比
相比纯文本或单轮图像理解基准,MineExplorer 把评测拉回了“具身式决策”的本质。它不和传统学术榜单抢名次,而是补上了长程自主执行这块短板。对做智能体的团队来说,它比通用聊天评测更有参考价值,因为真实业务里的任务几乎都是多步、跨时空的,而不是一问一答。
行业影响或适用场景
说白了,MineExplorer 开源后,会成为智能体研发的一面“照妖镜”:哪些模型真能干活、哪些只是会聊天,一眼可见。它适用于机器人仿真、游戏 AI、自动操作助手等需要长程规划的方向,也为企业选型提供了硬指标。随着长程任务成为智能体落地的关键门槛,这类基准的价值还会持续放大。