硅基流动上线开源模型 Hy4 preview,770B 总参数、1M 上下文
核心亮点
硅基流动(SiliconFlow)开源了 Hy4 Preview,总参数达到 770B 量级,再次把国产开源大模型的体量推到新的水位。说白了,这是在 MoE 架构下用稀疏激活控制实际算力消耗,让一个超大号模型既能秀肌肉、又能跑得起。对国内开源社区来说,这类重量级模型的放出,意味着训练与推理生态又多了一块可自由微调的基石。
具体能力或事件经过
Hy4 Preview 以开放权重的形式发布,配套的推理框架和部署说明同步给出,开发者可以自行下载、微调并在业务里落地。从发布方披露的定位看,它瞄准的是长上下文、复杂推理与多语言能力的综合表现,试图在开源阵营里对标海外的顶级闭源模型。社区最关心的,是它在实际任务里的性价比和显存占用是否真的友好。
技术细节
770B 总参数通常意味着 MoE 结构,真正激活的参数远小于此,因此单次推理的成本可控。开源版本若附带详细的推理优化(如量化、张量并行、KV 缓存管理),会大幅降低部署门槛。对国内团队而言,能否在国产算力卡上稳定跑通,是这类模型真正落地的关键,也是和海外生态拉开差异的验证点。
与竞品对比
和 DeepSeek、Qwen 等国产开源旗舰比,Hy4 以更大总参数秀出上限;和海外的 Llama、Mixtral 比,它在中文与本地化场景上更有针对性。劣势是超大规模模型对部署资源和工程能力要求更高,中小团队往往需要云端推理服务才能用得上,开源的"自由"在硬件面前打了折扣。
行业影响或适用场景
对开发者,Hy4 提供了一个可研究、可改写的超大模型样本,有助于推动国内训练方法论的公开交流。对企业,它增加了在闭源 API 之外的自主可控选项。对整个开源生态,重量级模型持续放出,说明"开源能否追上闭源"的争论,正被一次次实打实的权重发布所改写。重量级模型持续放出,正用一次次实打实的权重发布,改写开源能否追上闭源的争论,也把训练方法论摊在阳光下。