Robot 具身智能模型系列
核心亮点
面壁智能联合 OpenBMB 推出全球首个开源的具身智能(Embodied AI)模型系列 MiniCPM-Robot,把原本停留在论文里的视觉-语言-动作一体化能力,直接以可商用的开源权重形式释放出来。这意味着机器人开发者不必再从零训练,就能拿到一个能「看、懂、动」的基础模型,也意味着具身智能的研究门槛第一次对中小团队真正敞开。
具体能力或事件经过
该系列包含两个核心模型。其一是参数为 1.5B 的通用视觉-语言-动作(VLA)模型 MiniCPM-RobotManip,专注于机械臂的操控与操作任务,能够理解自然语言指令并映射到具体的抓取、移动动作。其二是 MiniCPM-RobotTrack,专门用于目标跟踪,让机器人持续锁定并跟随特定物体。与模型同步发布的还有高性能推理框架 PhyAI,目标是为机器人提供从感知、理解到记忆、行动的一体化运行底座,把分散的能力收进一条可部署的链路。
技术细节
VLA 模型的关键,是把视觉输入、语言理解和动作输出统一进同一个模型参数空间,让「看到什么、听懂什么、该做什么」端到端地打通。1.5B 的体量刻意控制在端侧可运行的范围内,配合 PhyAI 推理框架,能够把大模型的能力压到机器人本体的算力约束之内,而不必依赖云端往返。目标跟踪则让机器人具备持续的空间注意力,是复杂操作任务里不可或缺的前置能力。
与竞品对比
相比 Google RT 系列、斯坦福 VIMA 等以论文和闭源权重为主的方案,MiniCPM-Robot 的开源策略显著降低了具身智能的参与门槛。它延续了 MiniCPM 系列「小参数、端侧跑」的路线,在机器人这种对体积、功耗、实时性敏感的载体上更有落地优势,也让国内研究者能直接站在开源底座上做创新。
行业影响或适用场景
说白了,开源具身模型把机器人开发从「拼论文、拼算力」拉回到「拼应用」。教育科研、轻量服务机器人、桌面级机械臂开发者都能直接基于它做二次开发,加速具身智能从实验室走向真实场景的速度,也让国内在具身智能开源生态上占据了先发位置,后续的工具链与社区都会围绕它长出来。