近日,云原生分布式推理开源项目 llm-d 正式纳入沐曦曦云 C 系列 GPU 支持——这是 llm-d 官方支持的加速器名单中首次出现国产 GPU 的身影,也是沐曦股份继成为中国第一家与 vLLM 官方签署合作协议的芯片企业后,在开源推理生态上又落下的关键一子。
一款AI 芯片能否被市场规模化采用,越来越取决于它能否被主流开源软件栈“无感”调用,而不只是能否跑通几个推理引擎的 benchmark。
这也是沐曦股份与密瓜智能(Dynamia AI)此次合作、完成曦云 C 系列 GPU 在云原生分布式推理框架 llm-d 社区适配的看点所在——曦云由此成为 llm-d 官方加速器名单中首个国产 GPU,也让沐曦股份此前“中国第一家与 vLLM 官方签署合作协议的芯片企业”这一身份,有了更扎实的技术支撑。
说它“更进一步”,是因为 llm-d 本身就构建在 vLLM、SGLang 等推理引擎与 Kubernetes 之上,由 Red Hat 发起、目前托管于 CNCF(Cloud Native Computing Foundation)。它要解决的问题,是把单节点的推理引擎能力,升级为能做前缀缓存感知路由、负载感知调度、Prefill/Decode 分离的“生产级分布式推理系统”——这恰恰是大模型从“能跑”走向“规模化服务”时绕不开的一层,也是许多芯片停在半路的地方。
llm-d项目诞生至今已积累超过 4400 个 GitHub Star,英伟达、谷歌、AMD、英特尔等主流算力平台均已形成各自的部署指南,是当前分布式推理领域最具代表性的开源项目之一。
行业内一个容易被忽视的现实是:这类国际开源项目的默认配置,长期以国外芯片为假设前提。国产 GPU 就算已经能运行 vLLM 等主流推理引擎,用户想直接复用社区成熟的分布式部署方案,仍要自己摸索大量隐性适配细节——这也是过去国产芯片在生态层面“看得见、摸不着”的典型症结,沐曦此次适配,补的正是这一课。
落到具体路径上:单卡场景用 Qwen3-14B、TP=1 验证基础推理能力,八卡场景换成 DeepSeek-R1-Distill-Llama-70B、TP=8 验证大参数量模型的服务能力,而技术含量最高的 Prefill/Decode 分离路径,则基于 vLLM NixlConnector 与 llm-d 路由 Sidecar、并通过针对 NIXL 优化的 MIXL 大幅提升传输效率——这条路径被视为当前提升大模型推理资源利用率的关键方向之一,团队愿意把它作为验证重点,本身就说明了野心不小。性能标定的结果也印证了这一点:Qwen3-14B 单卡峰值 Prefill 吞吐达 5773 tokens/s,DeepSeek-R1-Distill-Llama-70B 八卡场景下为 5468 tokens/s,两组数据均已并入 llm-d 社区公开标定矩阵,意味着国内用户部署时可以直接引用真实硬件基线,不必再自行摸底;配套的 vLLM-MetaX 推理镜像也已上线公开仓库,进一步降低了使用门槛。
分工同样值得一提:沐曦股份负责测试运行环境、推理镜像及 MXMACA 软件栈层面的支持,密瓜智能承担 llm-d 侧的功能实现与端到端验证,并推动方案通过国际社区技术评审;双方各有一位工程师登记为该路径在 llm-d 社区的加速器维护者。换句话说,这不是提交一次 PR 就结束的合作,而是要持续跟进社区版本迭代的长期关系。
这种打法也不止于芯片厂商与开源项目之间的双边适配。就在不久前落幕的 2026 CCF 中国开源大会上,沐曦股份承办了“Token 经济下的开源 AI Infra 机遇和挑战”分论坛,发布了青年开源专项基金种子计划,还承办了面向高校师生和社区开发者的国产开源 GPU AI 创新生态赛。相比一次具体的技术适配,这些动作解决的是更长期的问题:谁会在国产 GPU 上写代码、做项目、留下来。
从签下 vLLM 官方合作协议,到率先完成 llm-d 适配,再到搭建面向社区和青年开发者的平台,沐曦股份是在用一连串具体的动作,回答“国产 GPU 能否真正进入国际主流开源基础设施”这个问题。对行业而言,这类适配和生态投入沉淀下来的位置,或许比单一芯片的算力参数更值得持续关注。
责任编辑:kj015