AI资讯tip
LLM 生成的推理引擎比 vLLM 快最多 90%
核心亮点
"让 AI 写自己的推理引擎"这件事,被 Baseten 跑通了。工程师参考 MetaInfer 论文,用 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4 精度、单张 B200)自动构建了一个叫 VibeQwen 的推理引擎,单流解码比 vLLM 0.25.1 快 90%,首 token 延迟从 28ms 降到 12ms,并发 32 时吞吐高 71%。
具体能力或事件经过
整个过程不是手搓 CUDA kernel,而是让 coding agent 读论文、写代码、跑 benchmark、再迭代。vLLM 作为业界主流开源推理框架,长期是性能基准线;VibeQwen 在同样硬件上直接碾压了它,说明"agent 辅助优化"已经能产出可落地的生产级内核。这件事的象征意义在于:推理优化的门槛第一次被 AI 自己大幅拉低。
技术细节
关键在于针对 NVFP4(4 位浮点)这一 Blackwell 架构特有的低精度格式做专门算子排布,并在单流与高并发两种负载下分别调优。首 token 延迟减半以上,意味着交互式场景的体感会明显更跟手;而并发吞吐的提升,则直接关系到单位算力的服务成本。
与竞品对比
相比 vLLM、TensorRT-LLM、SGLang 等需要资深工程师调优的框架,VibeQwen 的特别之处是"生成方式"而非"架构创新"。它证明,给定足够强的 coding agent 和明确目标,推理优化的工程门槛正在被显著拉低,小团队也能获得接近专家级的性能。
行业影响或适用场景
对中小团队来说,这意味着不必再养一个专职推理优化小组也能拿到接近专家级的性能。但也要冷静:自动化生成的引擎在稳定性、边界条件和长期维护上仍需人工把关,距离完全替代手写内核还有距离。它更像一个强力加速器,而非可以闭眼上线的黑盒。