深度 | 模型为芯片而生:DeepSeek V4 与昇腾 950 的共谋改变了什么

📅 发布时间:2026/8/11 0:45:14
深度 | 模型为芯片而生:DeepSeek V4 与昇腾 950 的共谋改变了什么
模型为芯片而生DeepSeek V4 与昇腾 950 的共谋改变了什么核心观点DeepSeek V4 不是适配了昇腾而是为昇腾协同设计——当开源世界最有分量的模型把架构写成昇腾原生国产算力第一次摸到了生态定义权。这是一篇深度研究不是新闻简报。基于 30 个来源的交叉验证覆盖技术架构、竞争格局、市场影响三个维度。证据等级[A] 官方/一手 [B] 2可靠来源 [C] 单一来源 [D] 个人判断一、被误读的八芯适配4 月 24 日 DeepSeek 发布 V41.6 万亿总参数、490 亿激活的 MoE1M 上下文开源权重。主流叙事把它包装成国产算力里程碑——八家国产芯片厂商 Day 0 全量适配。但这份叙事漏了最重要的细节。SemiAnalysis 在 6 月 17 日发布昇腾 950DT 的指令级拆解结论直接推翻适配这个词V4 的推理路径在发布之前就是照着昇腾的硬件写出来的。稀疏矩阵乘、专家路由的 Expert Gather 指令、FP4/FP8 混合精度——这些 V4 架构里最核心的设计恰好都是昇腾 NPU 最擅长、而通用 GPU 并不天生优化的东西。[A]黄仁勋在 4 月 15 日播客里说DeepSeek 若率先在华为芯片上跑通对美国是糟糕的结果。他没说完的下半句才是重点——他怕的不是跑通而是 CUDA 失去默认优化特权。[B]二、技术纵深V4 架构里写着昇腾的名字V4 相对 V3 做了四个激进改动每一个都偏离 GPU 惯例设计V4 的取舍对昇腾的意味注意力抛弃 MLA改 CSAHCA 混合压缩注意力稀疏索引与全局压缩贴合 NPU 稀疏访存多 Token 预测原生 MTP同时预测 t1…t3让 decode 从访存密集转向算力密集精度FP4 专家 FP8 非专家950PR 是国产唯一原生 FP4 芯片残差mHC 流形约束超连接减少中间激活省显存带宽1M 上下文下V4-Pro 每 token 的 FLOPs 只有 V3.2 的 27%KV 缓存只有 10%。[B] 在 1M 上下文场景里KV 缓存是从显存里挤出来的10% 意味着同样的卡能塞下十倍长的上下文也意味着昇腾相对小的片上内存不再是致命伤。昇腾 950DT 最关键的三个数字144GB 片上 HiZQ 2.0 内存、4TB/s 带宽、2TB/s 片间互联。[A] 144GB 对 MoE 推理是决定性的——1.6T 总参数、49B 激活的 V4-Pro所有专家权重放上单卡后推理只需搬运激活参数。这是全部专家常驻与专家换入换出的本质区别。Atlas 950 SuperPoD 在 WAIC 2026 真机首秀1024 卡、1 EFLOPS FP8、256TB 统一编址、3μs RTT最大可扩到 8192 卡。256TB 统一编址意味着 1.6T 参数的权重与 KV 可全部驻留在同一逻辑内存空间应用层不需要做跨机调度。华为公布的数字V4-Pro 在 950DT 上单卡 decode 约 4700 TPS、TPOT 约 20ms。对比 H20FP4 算力 2.87 倍。需要诚实标注这是厂商口径、8K 输入的离线指标。真正的独立验证来自另一个方向。SemiAnalysis 的追踪显示V4 发布当天只有 CUDA 和 CANN 两套栈能跑完整推理AMD ROCm 只有 1-2 tok/sNVIDIA 自己的 TensorRT-LLM 还踩了一个静默内存损坏的 bug修了几周。[A] V4 发布当天能完整跑起来的推理栈只有两套——CUDA和昇腾 CANN。上图V4 的四个激进设计与昇腾 950 硬件能力的对应关系。三、竞争格局八家赛马与英伟达的侧门八家国产芯片 Day 0 适配是被扁平化的表述。严格拆解Day 04 月 24 日只有昇腾和寒武纪Day 14 月 25 日海光、摩尔线程、沐曦、昆仑芯、平头哥、天数智芯六家通过智源 FlagOS 补齐 Flash 版适配壁仞单独完成了 Pro 版适配。[B] 唯一在 Day 0 拿出完整、可验证推理性能的国产栈只有昇腾。智源 FlagOS 做了三件事FlagGems 全算子替换Triton 写不依赖 cuDNN/cuBLAS、统一张量并行策略、FP4FP8→BF16 精度转换。这套抽象层让写一次、跑八家成为可能但代价是性能上限被锁在通用算子层——这就是为什么六家 Day 1 适配都没拿出可审计的性能数字。厂商芯片V4 适配公开性能华为昇腾 950DT/950PRDay 0协同设计4700 TPS 单卡 decode寒武纪思元 590/690Day 0代码开源无公开 V4 数据摩尔线程夸娥 S5000Day 1V4-Flash 吞吐 65.7%沐曦曦云 C500/C600Day 1无公开 V4 数据海光深算 DCU3Day 1无 V4 数据昆仑芯/平头哥/天数P800/真武/天核Day 1仅验证NVIDIAH20/H200CUDA Day 0中国份额已跌至约 8%对比表八家中只有华为拿出了可审计的 V4 性能数字。英伟达在中国三条路全受阻。H20 是被阉割的降级产品算力密度只有 H100 的约 40%被中国云厂商用脚投票H200 获准出口但到 2026 年 Q1 实际营收是零——北京以战略陷阱为由按住了审批。[B] 于是英伟达打出第四张牌把独立的 Vera CPU 卖给中国。Vera CPU 不是降级产品而是一台完整的 88 核 Armv9.2 服务器 CPU1.2TB/s 内存带宽定价远高于2 万美元。[B] 精妙之处在于出口管制管的是 GPU不管 CPU——这是监管后门。中国头部云厂商已计划采购 300 台双路 Vera 服务器做测试。但这条路同样悬AMD Venice 256 核声称单机柜吞吐是 Vera 的 3.3 倍美国也可能把管制扩展到 CPU。[D]上图2026 年国产算力与英伟达中国路线的关键节点。四、市场与生态估值、产能与定义权DeepSeek 的融资曲线三个月内被改写4 月锚定 100 亿美元估值5 月 28 日第一轮交割、投后约 520 亿美元、大基金首次投资一家大模型公司7 月第二轮投前估值已到 710 亿美元A 股 IPO 已列入 2027 年科创板日程。[B] 最有象征意义的不是金额而是大基金——这个历史上只投中芯、长鑫等硬件的国家队第一次把钱放进了一家软件公司。7 月 31 日彭博报道DeepSeek 计划在内蒙古乌兰察布建设 1GW 级智算中心投资约 350 亿美元采用自建租赁混合模式。但最关键的芯片方案至今未被证实——彭博原文说尚不清楚用谁的芯片中国部分自媒体声称全部国产而 8 月 8 日中国日报的说法更保守双方都未承诺建设。[C] 1GW 国产方案目前是叙事不是事实。产能账很朴素中芯 N2 年产能约 260 万颗2026 年需求约 420 万颗缺口 40%华为独占 43% 产能。[B] 昇腾 950 2026 年计划出货约 75 万颗路透字节跳动一家就锁走了一半HBM 是更硬的瓶颈——国产 HBM3 要等长鑫 2028 年才可能规模化。梁文锋在 7 月内部会上说的那句华为的问题是产能不是技术是对全局最精准的概括。[C]7 月 31 日国产算力板块史诗级大反攻科创芯片 ETF 涨 7.9%寒武纪 20cm 涨停、市值一度站上 5000 亿。[B] 政策底座更厚国家规划五年 2 万亿建全国算力网、2028 年国产芯片占比不低于 80%日本 8 月 1 日起对先进封装设备实施全面出口许可反向加速国产封装替代。上图国产算力的供需结构——需求被开源模型点燃供给被产能与 HBM 卡住。五、三个层次的博弈第一层是推理先行。国产芯片今天真正攻下的是推理市场——昇腾 950DT 的 decode 已摸到 H100 的 85-90%成本只有约四分之一。[B] 但训练仍是英伟达的天下V4 技术报告刻意不披露预训练硬件行业共识是H800 训练 昇腾推理/续训练的混合结构弃 CUDA叙事被夸大了。[C] 需要看到的是6 月 5 日昇腾 910C 集群已完成 V4-Pro 1.6T 全参数后训练MFU 34.22%这堵墙正在被一点点凿穿。[A]第二层是生态反向渗透。V4 的开源让昇腾从国产替代选项变成全球开发者默认选项之一。技术报告同期发布的 TileLang 是一套旨在逃离 CUDA 的 GPU 算子语言——DeepSeek 不只在芯片层面做国产化还在工具链层面给整个行业留了退路。第三层是定义权。当开源世界最有影响力的模型把架构做成昇腾原生开发者生态会围绕 CANN 生长正如二十年前围绕 CUDA 生长。我判断未来一年国产算力最大的变量不是芯片性能而是模型-芯片协同设计的深度——谁能让模型为自家芯片而生谁就掌握了生态的定义权。[D]六、我的判断我原以为国产算力跑万亿模型是工程成就现在看是范式转折。V4 与昇腾的协同设计第一次让芯片定义模型变成了现实——这在 AI 芯片史上只有 CUDA 时代做到过。最需要保持清醒的三点。第一性能数字基本是厂商口径4700 TPS 是离线最优值真实在线负载要等 950DT 8 月上线华为云后才有独立验证。第二国产训练闭环仍未完全跑通预训练依旧是英伟达主导910C 的 34% MFU 后训练是进步但离端到端国产还有距离。第三乌兰察布 1GW 的芯片方案悬而未决它可能是国产算力最大的增量订单也可能只是一篇彭博报道。我判断方向是确定的模型为芯片而设计的循环一旦转起来就不会倒转。MiniMax H3 在 8 月 3 日复制了同样的 Day 0 模式说明这不是 DeepSeek 的孤例而是中国开源生态的默认打法。下一个观察窗口是 9 月——昇腾 950 超节点批量商用时V4 的推理价格会降多少那是国产算力真正交卷的时刻。参考来源部分SemiAnalysis InferenceX — DeepSeek V4 Day 0→43 Performance华为 — Atlas 950 SuperPoD 发布DeepSeek-V4 技术报告arXiv:2606.19348路透 — 中国科技巨头抢购昇腾 950彭博 — DeepSeek 乌兰察布 1GW 数据中心芯东西 — 8 大国产 AI 芯片适配 DeepSeek-V4人民日报 — DeepSeek 跑在国产芯片上意味着什么财新 — 大基金领投 DeepSeekAI 辅助深度研究人工视角解读。每日更新。