DeepSeek 回归华为铁军——我们曾告诉你们公交车才是大戏

posted in: Uncategorized | 0

发表日期:2026年8月 · 3DN笔记

7月份,我们写道NVLink与富猫公司合作,而华为则开放了总线:面向企业NVIDIA堆栈的封闭式多GPU架构,面向其他基于国产NPU构建的公司开放式扩展互连语言。这不是一种时尚观点。这是对中国计算将尝试主导哪一边的赌注。

路透社报道称DeepSeek回归,推出了适应华为芯片的新一代模型,这是同一故事的软件部分。早期DeepSeek的病毒式传播是关于训练效率和开放权重。回归则是在不道歉的情况下,是否可以在非CUDA堆栈上使用前沿模型。

两种计算理念:封闭高速架构与开放NPU总线网格
我们为互连勾勒出的相同分支:少数人的封闭架构,主权堆栈的开放扩展。模型现在必须选择一边——或者同时支持两边。

DeepSeek的回归实际上意味着什么

剥离新闻周期,对于运营商和任何考虑数字主权的人来说,有三个事实很重要:

  • 该模型不仅仅是一个基准测试。专业版和闪光版、长上下文、代理编码和STEM优势是产品表面。战略表面是针对华为Ascend级加速器和超级节点集群的零日调优——而不是“它还在亚洲的其他地方运行。”
  • 推理是大众市场。大多数生产流量是推理,而不是全预训练。如果国产NPU对于以有竞争力的token成本服务开放权重来说“足够好”,那么CUDA就不再是AI工程工作的大部分必需品。
  • 训练仍然是困难的一半。之前将整个训练运行放在Ascend上的尝试据报道在互连稳定性和软件成熟度上遇到了问题。在国产硅片上进行部分训练和后训练是进步;它还没有达到“我们不再需要出口管制GPU来做任何事情。”诚实会使“我早就告诉过你”不会变成宣传。

所以,安静的记分牌不是“中国与NVIDIA平起平坐。”而是“中国可以发布一个严肃的开放权重模型,其首选平台是中国加速器堆栈。”这是一个不同的、更持久的声明。

我们已经说过了互连的一半

7月份的文章直言不讳地谈到了市场细分:NVLink级别的对等架构仅限于企业多GPU机器;消费者和小实验室设备仍使用PCIe;华为的UnifiedBus式开放性指向了另一个方向——将许多NPU链接成一台机器,而无需租用封闭俱乐部会员。

DeepSeek-on-Ascend是当权重出现时该论文的写法。没有模型的互连哲学是一篇白皮书。没有国产架构的模型将永远依赖于别人的板设计、内存映射和驱动路线图。将它们放在一起,你就得到了一个完整的路径:硅片、链接、运行时和权重。

我们不是在宣称无所不知。我们是在宣称模式识别。出口管制并没有冻结中国的人工智能;它们将资本转向了NPU集群、国产编译器和效率技巧,而西方实验室在H100s仍然是一个采购订单的情况下,对这些发明没有多少动力。

中国硬件独立性有多大可能性?

独立性不是一个布尔值。将其视为分层,每个层都有自己的概率,时间跨度为3到5年。

1. 在国产加速器上提供开放权重——高

对于许多企业和消费者推理工作负载,一个“足够好的”Ascend(或同级别)集群已经超越了“没有GPU”的情况,并且经常超越“等待稀缺的出口SKU”。软件内核以丑陋、迭代的方式赶上。一旦旗舰模型随附一流的支持,云提供商和内部平台就会标准化。锁定效应对双方都有影响:CUDA很粘,但国产默认值也是如此。

2. 中国内部竞争的多加速器架构——中高

这是7月份论证的UnifiedBus / SuperPoD方面。你不需要逐位复制NVLink来赢得国家能力。你需要足够的带宽和一个连贯的软件故事,以便张量并行和专家并行的多GPU(多NPU)任务不再在主机总线上失败。华为及其同行将继续错过NVIDIA的精美之处;他们也将继续出货训练和服务模型的机架,而西方国家无法在飞行中实施禁运。

3. 在没有西方GPU的情况下实现完全预训练平等等级——中,不均匀

Frontier预训练仍然喜欢密集的高带宽域、成熟的集体和一个CUDA形状的工具生态系统。国产堆栈正在缩小与选定工作负载和后训练的差距。在每个前沿运行、每个研究分支、每个半完成的实验内核上缩小差距的速度较慢。预计一段时间内会出现混合现实:一些阶段在任何仍然可以渗透的东西上,更多阶段在Ascend级别的铁上,对混合的无情压力。

4. 真正的端到端主权(光刻、HBM、EDA、工具)——较低,但在增强

加速器并非整个物料清单。先进工艺节点、HBM供应、封装和内存壁垒是地缘政治的瓶颈。中国可以通过更大的集群、更智能的稀疏性和更激进的量化来绕过一些限制。它无法通过新闻发布会的日程安排消除物理学或每个工具链的依赖。这里的独立性是一个跨十年的产业政策问题,而不仅仅是一个模型的发布。

5. 软件护城河(CUDA vs CANN 和朋友们)——真正的战斗

没有开发者的硬件就是一个仓库。DeepSeek级别的举措很重要,因为它将开源模型社区和代理框架拉向国产运行时。编码代理、长上下文应用和生产RAG不在乎你的品牌忠诚度;它们在乎的是延迟、价格,以及驱动程序是否在周一工作。每个更喜欢Ascend的严肃模型都在教新一代工程师,CUDA是可选的。

底线可能性:中国建立一个功能上主权的AI计算通道的可能性很高——足够的基础设施来训练、微调和服务国家重要的模型,而无需乞求NVIDIA的顶级SKU。全球默认值在一夜之间为每个西方实验室翻转的可能性很低。永久分裂的可能性中等:两个完整的堆栈、两种互连哲学、两套“最佳实践”博客文章。

这对您运行真实系统意味着什么

在3DN,我们关心的是生产,而不是游行花车。以下是一些实用的阅读材料:

  • 价格和可用性将继续按地区分歧。API定价和GPU租赁已经反映了谁可以购买哪种硬件。针对国产NPU优化的模型系列将使中国云定价进一步远离仅限于CUDA的报价。
  • 可移植性是一个产品特性。如果您的AI工程管道假设一个供应商的集合永远存在,您就是在为明天的迁移税买单。更喜欢开放权重、干净的推理接口,以及在新的堆栈声称平起平坐时重新基准测试的纪律。
  • 主权是操作性的,不是口号。对欧洲或亚洲运营商的数字主权不是“购买不同品牌下的同一封闭俱乐部”。它是知道在政策或供应链断裂时,您实际上可以移动哪些层——模型、运行时、加速器、设施。

托管托管和乏味的基础设施仍然获胜:电力、冷却、网络、可观察性和保持推理正常运行的乏味工作,同时模型新闻发布会轮换。

我早就告诉你们了,只是没有胜利的欢呼

我们说过,互连分叉是真实的。DeepSeek以华为为形式的回归,证明了分叉的模型方面。中国硬件独立性不是一种流行语,也不是一个完成的项目。它是一个概率分布,只是在最先重要的层面上向上移动 – 服务、微调和国家级容量 – 而最深的制造依赖关系仍然存在争议。

如果你只记得一行:禁运试图冻结一个客户;它可能资助了竞争对手的全栈。其余的是工程细节,而这些细节的进展速度比季度叙述所承认的要快。

相关: NVLink 适用于有钱猫,PCIe 适用于其他人 – 华为开辟了总线 · 欧洲、能源和人工智能:Ascend 上的 GLM 5.2 与 NVIDIA 上的 Grok

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注