Modal Clusters 正式发布,通过 @modal.clustered 提供多节点 GPU 集群
核心亮点
Modal 宣布 Modal Clusters 正式可用。通过一个装饰器 @modal.clustered,你就能拿到多节点 GPU 集群,节点间经 InfiniBand verbs 通信,带宽最高 6.4 Tbps,并且自动配置 PyTorch 和 NCCL。对做大规模训练、推理和分布式计算的团队,这意味着"多机集群"从运维噩梦变成一行注解。
具体能力或事件经过
过去要跑多节点训练,得自己配机器、网络、NCCL、容错,运维成本极高。Modal Clusters 把这一切收进一个装饰器:你写函数时标上 @modal.clustered,Modal 负责把多个节点拉起、连好高速网、装好框架,函数体里直接当单机多卡写就行。这种"声明式集群"降低了分布式训练的入门门槛,小团队也能碰大集群。
技术细节
6.4 Tbps 的 InfiniBand verbs 通信是这次的关键数字,意味着节点间几乎不是瓶颈,梯度同步、参数广播能跑满。自动配置 PyTorch 和 NCCL 则省掉了最容易出错的手动调参——很多分布式任务卡住,就是因为 NCCL 环境变量没设对。Modal 把它做成默认行为,开发者不必再和拓扑较劲,把精力放回模型本身。
与竞品对比
和 AWS SageMaker、GCP Vertex 的托管训练比,Modal 的优势是代码即基础设施、按秒计费、弹性伸缩,不用先建集群。和裸金属租用比,它省了全部运维。和 Ray 集群比,Modal 的上手更轻,装饰器范式对 Python 开发者更友好;代价是更绑定 Modal 的运行时,迁移成本要考虑。对要快速试大规模实验的团队,这是最省心的入口。
行业影响或适用场景
对初创和研究者,Modal Clusters 让"临时起一个 8 卡甚至 64 卡集群跑实验"变得像起一个函数一样简单,显著缩短从想法到大规模验证的周期。对企业需要突发算力的场景,按秒计费也比常驻集群省钱。分布式训练正从"基础设施工程"变成"几行代码的声明",Modal 这一发布是这股无服务器化浪潮的代表。