|
|
发表于 2026-7-28 18:43:38
|
显示全部楼层
华为昇腾0day适配Kimi K3,国产芯片跑通3万亿模型
【智迅文化 2026 年 07 月 28 日讯】7月28日,华为计算官方宣布,昇腾AI已实现对月之暗面Kimi K3的0day极速适配。这意味着,7月27日刚刚开源的Kimi K3,在发布当天就能在昇腾芯片上完成训练与推理部署。
Kimi K3是一个总参数量达2.8万亿的MoE大模型,是全球首个开源的3万亿级别模型。模型内置896个专家,单次推理仅激活16个专家参与计算。原生支持视觉理解,拥有100万token上下文窗口,KVCache压缩75%,长上下文解码速度最高提升6.3倍。海外测评中,Kimi K3已登顶Frontend Code Arena等多项榜单。
如此体量的模型在国产芯片上跑通并不容易。昇腾在训练侧基于MindSpeed MM套件,在Atlas 800 A3、Atlas 900 A3 SuperPoD上完成训练复现,通过FSDP+EP混合多维并行策略解决海量专家参数显存溢出问题;针对KDA低密度算子设计GEMM分组矩阵算子批量处理海量专家计算;通过ChunkLoss分块损失计算降低显存峰值。
推理侧同样打满了补丁。昇腾950超节点支持FP8、MXFP8、MXFP4全系列精度格式,原生兼容Kimi K3的mxFP4量化权重。通过vLLM Ascend与SGLang两大开源引擎落地优化,针对KDA架构设计Prefill与Decode双融合算子;MC2流水线打通专家路由、跨卡通信、计算回收全流程;SGLang新增DSpark投机推理,将单步生成时延压至50ms以内。
从Kimi K3开源到昇腾适配完成,中间几乎没有时间差。当开源模型遇上国产算力,“发布即能用”正在从理想走向常态。
|
|