AI AI工具情报站
国内AI动态 ai-products

多模态大模型训练新范式

📰 公众号:小红书技术(dots.llm) 📅 2026-07-22

核心亮点

小红书技术团队近日开源了名为 BigMac 的训练流水线新范式,专门面向“看图、听声音、懂文字”的综合能力多模态大模型。说白了,它解决的是一个很实在的工程难题:在训练又看又听又读的多模态模型时,如何既跑得快,又别把显存撑爆。BigMac 以模型流水线(pipeline)为主干,把编码器和生成器的计算安全地“嵌套”进去,在不打乱执行顺序的前提下实现加速。

具体能力或事件经过

根据公众号“小红书技术(dots.llm)”的介绍,BigMac 是一套依赖安全的嵌套流水线方案,代码已经公开并可免费使用。它的核心思路是把多模态训练中串行的模块——比如视觉编码器、音频编码器、语言模型主干——重新组织成一条流水线,让不同阶段的计算可以重叠执行。实际效果上,相比基线实现,BigMac 带来了 1.08x 到 1.9x 不等的加速,具体幅度取决于模型结构与 batch 配置。

技术细节

BigMac 的关键约束在于“激活显存有界”,也就是在加速的同时严格控制每一阶段激活值占用的显存,避免出现显存溢出导致训练中断。它通过把编码器与生成器的前向、反向计算嵌入到主干流水线中,并精心安排执行顺序,使得计算重叠而不破坏数值正确性。这种依赖安全的设计意味着它不需要改动模型结构本身,对现有训练框架的侵入较小,对无力从零重构模型的团队尤其实用。

与竞品对比

相比常见的流水线并行或单纯的算子优化,BigMac 的差异化在于它专为多模态“编码—生成”耦合结构量身设计,而不是通用的大模型并行方案。它不追求极限吞吐,而是把“有界显存下的稳定加速”作为第一目标。对一个已经在生产环境承担 dots 多模态模型训练任务的方案来说,这种稳健性比纸面峰值更重要。

行业影响或适用场景

BigMac 目前已作为小红书 dots 能看图、听声音、懂文字的综合能力模型训练的核心组件投入生产,说明它经过了真实业务流量的检验。对国内做多模态训练的团队而言,开源且免费意味着可以直接借鉴这套范式来优化自己的训练成本与效率,尤其在显存受限、模型规模持续变大的背景下,这种“省显存又提速”的思路会越来越多地被采用。