混合 GPU 桌面:Grok Build 在 Grok API 指令下使本地 Qwen 成为一流工作者

posted in: Uncategorized | 0

几周前,我们发布了一个严峻的结果:在我们的编码桌前,热GPU上的开放权重模型仍然输给了Grok 4.5。消费级3090级显卡从未接近过。即使是一次看起来很认真的H200级租赁运行,仍然无法完成支付房租的多小时基础设施工作。默认桌边自动化又回到了Grok API。公正的结论——对于任何拥有本地硅片的人来说,这有点令人沮丧。

我们拥有一台四核3090盒子,配有随时准备咆哮的EPYC 7543。在比较之后,很容易让人怀疑整个本地GPU的故事是否是一次撤资:沉没的资本,嗡嗡作响的风扇,以及仍然需要云计算来处理任何重要事情的编码代理。

然后,一个更安静的事实出现了。混合不是一个权宜之计。在Grok Build中,它是一个一级特性。运行在API上的Grok所使用的相同工具可以将探索代理、计划代理和自定义角色固定到一个本地与OpenAI兼容的端点——Qwen,或者你实际服务的任何开放权重——而父桌则留在Grok上进行判断、技能和生产发布。昂贵的前沿代币做出了艰难的转向。本地推理吸收了大部分机械工作。这就是LinkedIn一直争论的值得报道的部分:对于真正的编码代理来说,争论很少是“本地XOR云”。对于真正的编码代理来说,问题是“谁指挥谁,谁为哪些代币付费。”

阅读之前的帖子如果你想要纯粹的Grok对开放权重的比分。这篇文章是续集:为什么多GPU盒子在混合桌下仍然值得拥有,包括一些关于代币成本、电力和数学翻转的乏味算术。

之前的帖子实际上证明了什么

没有证明开源是无用的。它证明了对于3DN的编码代理工作负载——长时间会话、技能目录、固定规则、WP-CLI放置、公共卫生、缓存清除、外部证明——“相同的工具+更便宜的权重”在整个代理大脑是开放权重时是不够的。

开放权重看起来好的地方:

  • 连贯的英语和代码形状的文本
  • 短工具循环
  • 五分钟演示,可以在幻灯片上给人留下深刻印象

它们失败的地方:

  • 全天桌面的可预测技能加载和规则遵守
  • 上下文窗口和压缩与车队现实相冲突时的会话连续性
  • 发布路径不得泄露内部——只有当模型仍然遵循它时,工具才会有帮助

所以Grok仍然是默认的桌边大脑。这仍然是事实。混合并没有改变判决。它改变了物料清单。

混合作为Grok Build的一级公民

Grok Build 是代理工具:交互式 TUI、无头运行器、技能、子代理、工作流。它已经支持三种 API 后端(聊天完成、响应、消息),并允许您在任何与 OpenAI 兼容的 base_url 上注册 自定义模型 — 包括您多 GPU 服务器上的本地推理服务器。

混合模式故意设计得乏味:

  1. 父会话 在前沿 Grok 模型(API)上:拥有用户对话、默认规则、最终判断和高风险发布步骤。
  2. 自定义模型入口 用于本地权重(例如,LAN 上提供的 Qwen 编码器堆栈):全窗口上下文、温度和端点配置在工具配置中 — 而不是一个辅助脚本。
  3. 子代理模型覆盖:将 exploreplan 或自定义角色固定到本地模型 ID,以便批量研究、grep、草稿重构和只读扇出消耗本地 FLOP,而不是 API 令牌。

在配置方面,这并非民间传说。这是工具行为的文档:自定义模型部分、按类型 [subagents.models] 覆盖,以及可以默认使用与父模型不同的角色。父模型仍然进行协调。本地盒仍然工作。这是在 LinkedIn 线程上值得重复的产品声明,这些线程只讨论纯度。

什么留在 Grok API 上(以及原因)

保留前沿令牌以:

  • 模棱两可的产品决策和架构权衡
  • 技能密集型发布台,错过默认规则会很昂贵
  • 任何涉及公共内容、货币脊柱语言或面向客户的 OTAP 的内容
  • 当本地草稿错误但工具仍然需要一个称职的评判员时进行恢复

3DN 的家庭产品 — 托管托管、PolitiCap、ZZP2ZZP、DutchBud 银行 / 金融科技脊柱 — 不会因为 VRAM 温度而获得免费通行证。数字主权包括知道哪些步骤您不会省钱。

本地多 GPU 应该吸收什么

四核 3090 + EPYC 7543 级别盒式电脑非常适合:

  • 广泛并行探索:许多只读子代理同时采样
  • 重复代码转换、测试脚手架、日志分类草稿
  • 嵌入式风格和批量分类工作与台式相邻
  • 当父模型只需要摘要时,保持会话连续性成本低廉

推理是 GPU 机架的产品。CPU 盒子保持队列供给。这些都没有取代 Grok 在艰难的转折点上;它阻止您在不需要前沿判断的转折点上花费前沿费用。

成本计算(数量级,不是招股说明书)

数字在变化。以下内容可视为编码桌的规划草图,而不是刻在石头的 API 列表价格。重点在于账单的结构。

1. 纯 API 桌子

假设一个繁忙的工程日:长时间会话连续性,大上下文窗口,重复工具循环。前沿编码代理以输入和输出令牌定价;当会话时间长时,提示缓存和缓存命中率主导实际有效输入成本。在 Frontier 费率下,烧毁数百万个输入令牌的一天并不罕见 – 这是一个繁忙的桌子,有压缩和重新读取。

示例形状(用你自己的发票替换):

  • 前沿 API 的繁忙日:根据模型级别、缓存行为以及你重新发送历史的频率,价格从几十到低数百欧元不等
  • 轻松日:远少于 – 但平均月度被那些艰难的日子拉高

提示缓存是纯 API 桌子的好朋友。混合模式不会移除缓存;它减少了你对昂贵模型的需求频率。

2. 纯本地桌子

一个严肃的多 GPU 工作站的 Capex 并非免费。一个四消费级 GPU 盒子加上一个强大的 EPYC 主机是一个资本项目,根据你的购买和冷却方式,价格从数千到低万欧元不等。电力是运营线:在连续负载下,多 GPU 功耗加上 CPU 是一个非微不足道的 kWh 故事。以欧洲工业或办公室费率计算,一个 24/7 平均几百瓦的盒子是一个显著的月度费用;一个在全推理下飙升到千瓦级的盒子更响。

纯本地隐藏的成本是质量:如果代理无法完成桌面工作,你仍然支付电力,你仍然支付人工完成。这是我们在开放权重试验后的撤资恐惧。

3. 混合桌子

混合模式的目标是:

  • 折旧 Capex 对本应该击中 API 的大量令牌
  • 集中 API 支出 在高价值转折点(判断、发布、艰难调试)
  • 本地利用率足够高 以至于 GPU 不仅仅是装饰性的暖气

一个简单的盈亏平衡草图:

每月混合价值 ≈
  (避免的 API 令牌 × 有效前沿费率)
  − (电力 + GPU 盒子维护份额)
  − (保持本地堆栈诚实的额外工程时间)

如果探索和草拟子代理占工具流量的 60-80%,并且这些在本地运行,那么即使父模型保持 Grok,前沿账单也会缩水。EPYC/3090 套件不再是一个失败的“替换 Grok”项目,而是成为 Grok Build 指南下的令牌成本缓冲器。

工作玩具数字(故意四舍五入 – 插上你的发票):

  • 假设纯 API 月份平均每个繁忙工作台的编码代理令牌成本为 800 欧元。
  • 混合模式将一半的呼叫量转移到本地权重,但这些是更便宜的判断转向;边境支出可能比 50% 更多下降 35–50%,因为剩余的 API 转向更密集。
  • 假设边境降至 450–520 欧元。本地电力 + 操作箱每月可能为 40–120 欧元,具体取决于工作周期和电力。净额:在计算延迟收益和大量日志保持本地存储之前,仍有数百欧元的月度裕度。
  • 如果工作台安静(每月 150 欧元 API),混合模式的绝对节省会减少,操作箱大多是一个实验室。Capex 则需要第二份工作:批处理推理、客户演示、离线提示红队——不仅仅是编码代理。

这就是诚实的计算。混合模式不是神奇的 ROI。它是一个组合:在重要的地方有边境质量,在呼叫量大的地方有本地 FLOPs。

LinkedIn 的虚假二分法

Feed 喜欢争论:“本地模型是唯一的主权路径” vs “本地模型是角色扮演;只有边境 API 有意义。”两个口号都跳过了驾驭。

  • 纯本地 优化离线和每个令牌的单位成本,并且在多小时代理可靠性方面往往表现不佳。
  • 纯 API 优化上游的质量和改进速度,并且可能为机械转向支付过高费用。
  • 真实代理驾驭下的混合模式 根据角色分配模型:导演 vs 工作者,发布 vs 探索,长判断 vs 大量转换。

对于托管托管和 AI 工程商店来说,数字主权不是“永远不要调用 API”。它是知道你信任哪个控制平面,数据在批量任务中的位置,以及令牌成本如何映射到产品交付——包括代理触及货币形系统时背后的金融支柱(DutchBud 银行、虚拟信用、闭环账本语言)。

我们现在如何看待 quad-3090 + EPYC 盒子

不是失败的 Grok 替代品。一流的工人池:

  1. 在 Harness 已经理解的 OpenAI 兼容端点上提供开放权重。
  2. 将它们注册为自定义模型;诚实地设置上下文窗口,以便压缩保持合理。
  3. 将高容量子代理类型固定到本地 ID;将父代保留在 Grok 上。
  4. 每月测量 API 发票和 GPU 工作周期。如果本地利用率低,扩展可以安全卸载的内容——不要假装机架很忙。
  5. 永远不要卸载错误答案成为公共事件的步骤。

这就是工程,不是炒作。生产工作台更关心会话连续性、缓存命中率和有效输入成本,而不是赢得截图战争。

我们没有声称的

  • 在我们的完整桌面上,任何本地 Qwen 构建都无法在与 Grok 4.5 的对决中胜出(当整个大脑是本地时,我们已经测量了相反的结果)。
  • 保证 GPU 投资回报率或致富基础设施故事。
  • 混合模式消除了对面向客户发布的人工审查的需求。
  • 当我们提到 DutchBud 或金融科技时,许可的开放银行或法定现金取款幻想——虚拟信用和产品语言仅此而已。

总结

开放权重试验教会了我们不要贬低前沿桌脑。混合设计教会了我们不要将多 GPU 投资束之高阁,使其成为令人失望的博物馆。在 Grok Build 下,本地推理和 Grok API 不是争夺同一王位的对手。API 仍然是硬编码代理工作的导演。本地 GPU 盒子成为了一名批量工人——在牵引力方面是头等舱——可以在不牺牲使我们在八月欢呼的质量标准的情况下,将昂贵的 Grok API 量从发票中移除。

如果你在 LinkedIn 上争论本地模式与云模式,问一个更尖锐的问题:你的代理牵引是否将混合模式视为产品功能,还是周末脚本?我们的做法是前者。EPYC 和 3090 可以再次咆哮——在指导下。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注