AI AI工具情报站
国内AI动态 ai-models

Robot 系列模型,含 1.5B VLA 与 0.9B 跟踪模型

📰 公众号:面壁智能(MiniCPM) 📅 2026-07-20

核心亮点

面壁智能联合 OpenBMB 发布并开源 MiniCPM-Robot 系列,包含通用 VLA(视觉-语言-动作)模型 MiniCPM-RobotManip(15 亿参数)与移动跟踪模型 MiniCPM-RobotTrack(9 亿参数)。这是端侧机器人大模型的一次重要补位,把原本需要数据中心支撑的具身智能,压缩到可在本地设备运行的轻量规模。

具体能力或事件经过

MiniCPM-RobotManip 定位“通用操作”,负责让机械臂理解语言指令与视觉画面,规划并执行的抓取、摆放等动作;MiniCPM-RobotTrack 则专注“移动跟踪”,让机器人持续锁定目标物体或人,实现跟随与避障。两者参数分别仅 1.5B 与 0.9B,却要完成过去动辄数十 B 的视觉语言模型才敢触碰的具身任务,说明面壁在模型压缩与机器人专用架构上做了针对性取舍。全系列开源,意味着开发者可在自己的硬件上微调与部署。

技术细节

VLA 模型的难点在于把“看、说、做”统一到一条推理链:模型先编码图像与语言,再输出动作 token 或控制信号。15 亿参数要做到可用,需要在数据配方(仿真+真实轨迹)、动作表征(离散化 vs 连续回归)与蒸馏策略上精细设计,避免小模型在长程任务中遗忘目标。RobotTrack 的 0.9B 则更像实时感知模块,以低延迟维持对目标的稳定跟踪,适合嵌入式摄像头与移动底盘的算力约束。

与竞品对比

与 RT-2、OpenVLA 等动辄几十亿参数的机器人大模型相比,MiniCPM-Robot 的显著标签是“小且开源”。大模型能力上限高,却难在端侧实时运行;面壁选择用更小的体量换取可部署性,契合国产机器人“低成本、快落地”的需求。开源策略也让高校与创业团队能零门槛接入,加速具身智能的平民化。

行业影响或适用场景

说白了,机器人能不能普及,关键在“大脑”是否便宜、能否本地跑。MiniCPM-Robot 把 VLA 与跟踪能力压到端侧,可服务于教育机器人、仓储分拣、家庭陪护、农业巡检等场景,减少对云端与高算力卡的依赖。对国内硬件生态,这类轻量开源模型是连接“国产芯片+国产机器人”的粘合剂,有望降低整体方案成本,推动具身智能从实验室走向流水线。