AI AI工具情报站
国内AI动态 paper

首个《我的世界》分钟级长程任务评测基准发布

📰 公众号:龙猫LongCat(美团) 📅 2026-07-23

核心亮点

首个《我的世界》分钟级长程任务评测基准发布。这背后的信号是美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级能看图、听声音、懂文字的综合能力AI模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面代码公开可免费。它把原本停留在实验室的能力进一步推向真实业务场景。

具体能力或事件经过

美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级能看图、听声音、懂文字的综合能力AI模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面代码公开可免费使用 这一事件表明,相关能力已经从概念验证走向可感知的产品体验,用户能在日常工作中直接感受到效率变化。

技术细节

技术细节上,厂商普遍在推理成本与质量之间做权衡:通过稀疏激活、KV cache 压缩、量化等手段压低单位 token 开销,同时用强化学习与人类反馈把模型行为收敛到可用区间。真正决定落地的,往往是长上下文下的注意力稳定性与工具调用可靠性,而非纸面参数。

与竞品对比

面对 OpenAI、Anthropic、Google 与开源阵营的夹击,模型厂商的护城河越来越依赖生态、工具调用与垂直场景,而非单一基准分数。开源权重的有无,正成为中小团队能否低成本接入的分水岭。

行业影响或适用场景

对应用开发者,模型能力不断上探意味着更多任务可端到端自动化,但也要求建立跨厂商选型与降级机制,避免单点锁定。把关键链路放在可替换的抽象上,才是经得起变化的工程选择。

延伸视角

务实的做法是保留备用模型与路由层,这样单一厂商的故障或涨价不会拖垮整个产品。

延伸视角

务实的做法是保留备用模型与路由层,这样单一厂商的故障或涨价不会拖垮整个产品。

延伸视角

务实的做法是保留备用模型与路由层,这样单一厂商的故障或涨价不会拖垮整个产品。