三角洲,不是河流:以路由器为单位,以睡眠为HA,以互联网为地图

posted in: Uncategorized | 0

Frontier 模型一次性失败了三次操作测试:它们不会在不冒着旧技能风险的情况下接受新技能,它们没有夜班,而且服务权重是唯一的副本。增量学习可塑性维护是同一个问题,只是名字不同。通常的答案是更大的河流——更多的HBM,更多的令牌,相同的网格。

3DN想要一个delta

语言是公共汽车——令牌是货币

LLM 的工作不仅仅是“说话”。在预训练后,它已经拥有了共享令牌空间、下一个令牌控制以及通过文本学习的堆叠世界模式。语言是训练媒介和 I/O 格式。在内部,网络从未见过英文字母;它看到的是令牌 ID → 嵌入 → 注意力 → 下一个 ID 预测。

这就是为什么模块化系统仍然从训练好的骨干开始:你继承了分词器、嵌入空间和权重,这些权重已经将人类文本映射到可用的向量语言。你将模块挂在那个公共汽车上。你不会从一堆小专家中发明英语,并希望他们后来发明语法。

路由器是不同的工作。一个唯一输出是“哪个专家得到这个”的调度器不应该聊天。自然语言是错误的控制平面,不适合那个跳跃。

叶子,不是汤

如果任务固定且密集——例如一个 8×8 符分类器,专家可以是 ~19k 个参数和 20 秒在一个单一的GPU上。该网络不应该首先看到英语。通过聊天模型发送 64 个浮点数,以便它可以说“看起来像 A”是更慢、更模糊、更差的。

从头开始训练便宜的模型。重用昂贵的模型。将专家 I/O 保持在张量、类 ID 或一个小代码本中。只在输出必须是语言的地方使用语言模型。

工作 正确模块大小
8×8 符 10k–100k
哪个专家?(路由器) 10k–在嵌入上几百万
检索相似文档 嵌入模型,不是聊天模型
写一个解释 LLM
运行代码 解释器,不是网络

模型内部的 MoE ≠ 模块化系统

在当前的 LLM 讨论中,专家混合通常意味着在同一个 Transformer 中稀疏的专家 FFN:相同形状、令牌级门、共享残差流(Mixtral / Switch / DeepSeek 风格)。行业俚语从旧的“门 + 异构专家”中漂移而来。

我们对基础设施人工智能工程桌的理解更接近于宏观专家:单独的网络或模型,请求级别的路由,你可以离线训练的专家,而无需接触编写者。你可以同时运行两者:外部路由器选择子系统;内部MoE选择每个令牌的FFN触发。

路由器是你仍然可以教导的单元

一个小门槛的重建成本低,运行成本也不高。重播调度日志,用一个新类扩展输出头,几分钟内重新训练——无需接触专家。冻结专家;只有路由器(可能还有新专家)得到梯度。新问题类型 = 新专家索引。旧索引保持稳定。不确定 → 回退通才,然后在睡眠中标记遗漏。

重复门槛,边界付费:任务家族 → 技能 → 版本 → 物理。相同的对象堆叠:

请求
  → SRAM路由器     # 在缓存/此芯片中完成
  → HBM路由器      # 本地GPU工作集
  → 板路由器    # 节点上的其他GPU
  → 织物路由器   # 其他节点
  → 区域路由器   # 其他设施/居住/成本

语义说什么应该运行。层级说在哪里允许运行。这就是有NUMA意识的调度,带有训练信号:错误路径 + 延迟 + 移动字节 + 能量 + 居住。大多数令牌永远不需要泛化到泛化阶段。

如果每个小操作都是一个学习过的路由器,你支付跳跃错误和延迟。当下一个部分可以单独训练时,值得隔离以防止遗忘,并且对于大多数输入可以跳过时,使用路由器。不要路由一个便宜的始终开启的变换。

睡眠是HA,不是诗歌

密集前沿服务权重就是知识。没有可离线的备用叶片。模块化路由使维护窗口成为可能:

  • 双胞胎服务。
  • 双胞胎重播,蒸馏,修剪,评估。
  • 原子交换:冷变热。
  • DAG的其余部分保持运行。

这就是高可用性加上整合——工程版本的梦周期的表兄。将双胞胎放在小高周转模块上(路由器、分类器、工具)。保留一个巨大编写器的副本,直到你可以将其蒸馏。在3090级盒子上的20秒重新训练是一个现实的睡眠周期;全面前沿重新训练则不是。

这不会在冻结的API叶片中创造生物可塑性。它绕过了“一个网络,一个终身梯度”的故障模式。可塑性≈我们仍然可以添加容量。增量学习≈我们可以添加技能而无需全面重新训练。睡眠≈我们可以在线离线重写模块。

内存墙:河流 vs 三角洲

大型 LLM 的推理通常受内存带宽限制:从 HBM 拉出一个巨大的重量块,进行廉价矩阵乘法,拉出下一个块。当热专家紧贴 ALU 时,小网格网格获胜,只有路径的权重移动。如果跳跃在织物上变得啰嗦,墙就会移动——然后你用网络墙来交换重量墙。

分层路由器使距离可见。避免流式传输 70B 块的流量是一个功能,不是一个错误——这是对层次结构的受控上升。一条河变成一个交错的三角洲:大部分水永远不会离开近道;只有洪水阶段的问题才会把深水通道带到通才。

三角洲淤积(死专家、总是晋升的门、默认路由上的负载崩溃)。睡眠和重放是疏浚。层次结构和固定是堤坝。退回到主通道是你要故意保留的洪泛区。

互联网韵律

数据包网络已经解决了“大量类型,距离昂贵,部分失效,边缘策略。”分层路由器、本地默认、必要时晋升、叶子上的智能——这就是 BGP 和 CDN,只是名词不同。你的 SRAM/HBM/板/区域门票在票(类型、预算、居住)上进行路由。专家是服务器。

默认转发保持不变。大多数数据包应该意味着:移动这些位,不要解释它们。转换是在声明的过渡点(opaque | reduce | policy | enrich)上选择加入,并附带收据。如果工厂在睡觉或不可信,运河仍然承载字节。一个只能转换的互联网是一个中间盒。一个既可以转发又可以有时转换的互联网是一个三角洲,绕过每个工厂。

这没有解决什么

  • 组合仍然需要一个编排者;混合是管道,不是一个超大枚举类型。
  • 共享事实仍然需要检索/内存,否则它们会在叶子节点上分叉。
  • 开放的问题类型清单(在睡眠中发现集群残留)并不是第一天就完全设计的。层次结构使每个门都保持小。
  • 泥潭——那些不会停留在类型中的任务——是你仍然需要支付前沿通才(或人类)的代价。架构的工作是随着时间的推移使这个泥潭变小。

3DN 如何运行不完整的版本

这不仅仅是一幅画。在3DN家庭的办公桌上,我们已经将工作流程设计为一种混合织物:用于判断和长时间会议的前沿Grok,用于批量推理和翻译的本地GPU工人,离线训练的适配器,以便服务基础保持冻结,必须不重写每个跳跃的密封路径。DutchBud银行虚拟信用和PolitiCap公民市场是同一根脊柱上的家庭产品——工作·金钱·政治——其中dibs是闭环游戏信用,不是赌场现金,也不是持牌开放银行索赔。

PolitiCap的公共磁带是野外早期的宏路由器:命名的目的地(代码)、只追加的收据(评论和填充)、当第一次通过的双方发生冲突时可选的第二次跳跃。WordPress是一个糟糕的张量织物和一个体面的政治资本的离线总线。同样的规则适用:默认向前;辩论是一个选择加入的过渡点,有一个跳跃预算——而不是每个标题上的五个完整沙龙。

文章是画。办公桌是第一条小溪。建造三角洲:小专家,热/冷睡眠,分层距离,默认不透明向前。不要从模块中发明语言。在语言之上发明模块——并在每个昂贵的路径前面放一个一次性门。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注