AI AI工具情报站
模型动态MarkTechPost(RSS)

动作模型

📰 MarkTechPost(RSS)📅 2026-08-05T08:25:11.000Z

核心亮点

NVIDIA 正式发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专门面向自动驾驶的长尾事件。长尾事件指真实道路中极少出现却极危险的 corner case,如罕见动物横穿、异形障碍物、极端天气下的非常规车辆。传统感知模型在样本稀缺时表现不稳,而 VLA 把"看到什么""如何理解""下一步怎么动"统一在一个模型里,面对未知也能给出合理动作。更值得注意的是,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码用 Apache 2.0,发布首日即可商用,这在自动驾驶开源领域相当少见。

事件经过

此次发布由 NVIDIA 官方披露,模型定位为可直接用于实车的开源 VLA 方案。与只在论文亮相的研究模型不同,它从第一天起就附带可商用权重与代码,把"研究"与"产业可用"门槛直接抹平。对车企和初创公司,意味着不必从零搭建端到端模型,也能接入大厂训练的通用动作底座。

技术细节

VLA 把视觉编码、语言推理与动作解码融合进同一网络。34B 体量在端到端自动驾驶模型里属中大型,兼顾表达与部署可行性。权重走 OpenMDW-1.1、代码走 Apache 2.0 的双许可,体现 NVIDIA 对开源合规的考量:权重与工程实现分开授权,既护生态又便集成。

与竞品对比

相比特斯拉那种封闭、黑盒的端到端方案,Alpamayo 2 Super 的差异化就是"开放"。相比只开源代码不开放权重的学术项目,它连权重都放出且允许商用。直接竞品还包括 Wayve、Waabi 等端到端方案,但多为闭源商业产品。NVIDIA 显然想用开放生态绑定更多开发者。

行业影响

简单来说,把 34B 级 VLA 模型以可商用方式开源,会显著降低长尾场景研发门槛。中小团队可快速搭原型,大厂也能当基线二次训练。长期来看,这种"开放权重加开放代码"的组合,可能推动自动驾驶从各自为战走向共享底座,加速行业在 corner case 上的集体进步。