几周前,我们发布了一个严峻的结果:在我们的编码桌前,热GPU上的开放权重模型仍然输给了Grok 4.5。消费级3090级显卡从未接近过。即使是一次看起来很认真的H200级租赁运行,仍然无法完成支付房租的多小时基础设施工作。默认桌边自动化又回到了Grok API。公正的结论——对于任何拥有本地硅片的人来说,这有点令人沮丧。
我们拥有一台四核3090盒子,配有随时准备咆哮的EPYC 7543。在比较之后,很容易让人怀疑整个本地GPU的故事是否是一次撤资:沉没的资本,嗡嗡作响的风扇,以及仍然需要云计算来处理任何重要事情的编码代理。
然后,一个更安静的事实出现了。混合不是一个权宜之计。在Grok Build中,它是一个一级特性。运行在API上的Grok所使用的相同工具可以将探索代理、计划代理和自定义角色固定到一个本地与OpenAI兼容的端点——Qwen,或者你实际服务的任何开放权重——而父桌则留在Grok上进行判断、技能和生产发布。昂贵的前沿代币做出了艰难的转向。本地推理吸收了大部分机械工作。这就是LinkedIn一直争论的值得报道的部分:对于真正的编码代理来说,争论很少是“本地XOR云”。对于真正的编码代理来说,问题是“谁指挥谁,谁为哪些代币付费。”
阅读之前的帖子如果你想要纯粹的Grok对开放权重的比分。这篇文章是续集:为什么多GPU盒子在混合桌下仍然值得拥有,包括一些关于代币成本、电力和数学翻转的乏味算术。
之前的帖子实际上证明了什么
它没有证明开源是无用的。它证明了对于3DN的编码代理工作负载——长时间会话、技能目录、固定规则、WP-CLI放置、公共卫生、缓存清除、外部证明——“相同的工具+更便宜的权重”在整个代理大脑是开放权重时是不够的。
开放权重看起来好的地方:
- 连贯的英语和代码形状的文本
- 短工具循环
- 五分钟演示,可以在幻灯片上给人留下深刻印象
它们失败的地方:
- 全天桌面的可预测技能加载和规则遵守
- 上下文窗口和压缩与车队现实相冲突时的会话连续性
- 发布路径不得泄露内部——只有当模型仍然遵循它时,工具才会有帮助
所以Grok仍然是默认的桌边大脑。这仍然是事实。混合并没有改变判决。它改变了物料清单。
混合作为Grok Build的一级公民
Grok Build 是代理工具:交互式 TUI、无头运行器、技能、子代理、工作流。它已经支持三种 API 后端(聊天完成、响应、消息),并允许您在任何与 OpenAI 兼容的 base_url 上注册 自定义模型 — 包括您多 GPU 服务器上的本地推理服务器。
混合模式故意设计得乏味:
- 父会话 在前沿 Grok 模型(API)上:拥有用户对话、默认规则、最终判断和高风险发布步骤。
- 自定义模型入口 用于本地权重(例如,LAN 上提供的 Qwen 编码器堆栈):全窗口上下文、温度和端点配置在工具配置中 — 而不是一个辅助脚本。
- 子代理模型覆盖:将
explore、plan或自定义角色固定到本地模型 ID,以便批量研究、grep、草稿重构和只读扇出消耗本地 FLOP,而不是 API 令牌。
在配置方面,这并非民间传说。这是工具行为的文档:自定义模型部分、按类型 [subagents.models] 覆盖,以及可以默认使用与父模型不同的角色。父模型仍然进行协调。本地盒仍然工作。这是在 LinkedIn 线程上值得重复的产品声明,这些线程只讨论纯度。
什么留在 Grok API 上(以及原因)
保留前沿令牌以:
- 模棱两可的产品决策和架构权衡
- 技能密集型发布台,错过默认规则会很昂贵
- 任何涉及公共内容、货币脊柱语言或面向客户的 OTAP 的内容
- 当本地草稿错误但工具仍然需要一个称职的评判员时进行恢复
3DN 的家庭产品 — 托管托管、PolitiCap、ZZP2ZZP、DutchBud 银行 / 金融科技脊柱 — 不会因为 VRAM 温度而获得免费通行证。数字主权包括知道哪些步骤您不会省钱。
本地多 GPU 应该吸收什么
四核 3090 + EPYC 7543 级别盒式电脑非常适合:
- 广泛并行探索:许多只读子代理同时采样
- 重复代码转换、测试脚手架、日志分类草稿
- 嵌入式风格和批量分类工作与台式相邻
- 当父模型只需要摘要时,保持会话连续性成本低廉
推理是 GPU 机架的产品。CPU 盒子保持队列供给。这些都没有取代 Grok 在艰难的转折点上;它阻止您在不需要前沿判断的转折点上花费前沿费用。
成本计算(数量级,不是招股说明书)
数字在变化。以下内容可视为编码桌的规划草图,而不是刻在石头的 API 列表价格。重点在于账单的结构。
1. 纯 API 桌子
假设一个繁忙的工程日:长时间会话连续性,大上下文窗口,重复工具循环。前沿编码代理以输入和输出令牌定价;当会话时间长时,提示缓存和缓存命中率主导实际有效输入成本。在 Frontier 费率下,烧毁数百万个输入令牌的一天并不罕见 – 这是一个繁忙的桌子,有压缩和重新读取。
示例形状(用你自己的发票替换):
- 前沿 API 的繁忙日:根据模型级别、缓存行为以及你重新发送历史的频率,价格从几十到低数百欧元不等
- 轻松日:远少于 – 但平均月度被那些艰难的日子拉高
提示缓存是纯 API 桌子的好朋友。混合模式不会移除缓存;它减少了你对昂贵模型的需求频率。
2. 纯本地桌子
一个严肃的多 GPU 工作站的 Capex 并非免费。一个四消费级 GPU 盒子加上一个强大的 EPYC 主机是一个资本项目,根据你的购买和冷却方式,价格从数千到低万欧元不等。电力是运营线:在连续负载下,多 GPU 功耗加上 CPU 是一个非微不足道的 kWh 故事。以欧洲工业或办公室费率计算,一个 24/7 平均几百瓦的盒子是一个显著的月度费用;一个在全推理下飙升到千瓦级的盒子更响。
纯本地隐藏的成本是质量:如果代理无法完成桌面工作,你仍然支付电力,你仍然支付人工完成。这是我们在开放权重试验后的撤资恐惧。
3. 混合桌子
混合模式的目标是:
- 折旧 Capex 对本应该击中 API 的大量令牌
- 集中 API 支出 在高价值转折点(判断、发布、艰难调试)
- 本地利用率足够高 以至于 GPU 不仅仅是装饰性的暖气
一个简单的盈亏平衡草图:
每月混合价值 ≈ (避免的 API 令牌 × 有效前沿费率) − (电力 + GPU 盒子维护份额) − (保持本地堆栈诚实的额外工程时间)
如果探索和草拟子代理占工具流量的 60-80%,并且这些在本地运行,那么即使父模型保持 Grok,前沿账单也会缩水。EPYC/3090 套件不再是一个失败的“替换 Grok”项目,而是成为 Grok Build 指南下的令牌成本缓冲器。
工作玩具数字(故意四舍五入 – 插上你的发票):
- 假设纯 API 月份平均每个繁忙工作台的编码代理令牌成本为 800 欧元。
- 混合模式将一半的呼叫量转移到本地权重,但这些是更便宜的判断转向;边境支出可能比 50% 更多下降 35–50%,因为剩余的 API 转向更密集。
- 假设边境降至 450–520 欧元。本地电力 + 操作箱每月可能为 40–120 欧元,具体取决于工作周期和电力。净额:在计算延迟收益和大量日志保持本地存储之前,仍有数百欧元的月度裕度。
- 如果工作台安静(每月 150 欧元 API),混合模式的绝对节省会减少,操作箱大多是一个实验室。Capex 则需要第二份工作:批处理推理、客户演示、离线提示红队——不仅仅是编码代理。
这就是诚实的计算。混合模式不是神奇的 ROI。它是一个组合:在重要的地方有边境质量,在呼叫量大的地方有本地 FLOPs。
LinkedIn 的虚假二分法
Feed 喜欢争论:“本地模型是唯一的主权路径” vs “本地模型是角色扮演;只有边境 API 有意义。”两个口号都跳过了驾驭。
- 纯本地 优化离线和每个令牌的单位成本,并且在多小时代理可靠性方面往往表现不佳。
- 纯 API 优化上游的质量和改进速度,并且可能为机械转向支付过高费用。
- 真实代理驾驭下的混合模式 根据角色分配模型:导演 vs 工作者,发布 vs 探索,长判断 vs 大量转换。
对于托管托管和 AI 工程商店来说,数字主权不是“永远不要调用 API”。它是知道你信任哪个控制平面,数据在批量任务中的位置,以及令牌成本如何映射到产品交付——包括代理触及货币形系统时背后的金融支柱(DutchBud 银行、虚拟信用、闭环账本语言)。
我们现在如何看待 quad-3090 + EPYC 盒子
不是失败的 Grok 替代品。一流的工人池:
- 在 Harness 已经理解的 OpenAI 兼容端点上提供开放权重。
- 将它们注册为自定义模型;诚实地设置上下文窗口,以便压缩保持合理。
- 将高容量子代理类型固定到本地 ID;将父代保留在 Grok 上。
- 每月测量 API 发票和 GPU 工作周期。如果本地利用率低,扩展可以安全卸载的内容——不要假装机架很忙。
- 永远不要卸载错误答案成为公共事件的步骤。
这就是工程,不是炒作。生产工作台更关心会话连续性、缓存命中率和有效输入成本,而不是赢得截图战争。
我们没有声称的
- 在我们的完整桌面上,任何本地 Qwen 构建都无法在与 Grok 4.5 的对决中胜出(当整个大脑是本地时,我们已经测量了相反的结果)。
- 保证 GPU 投资回报率或致富基础设施故事。
- 混合模式消除了对面向客户发布的人工审查的需求。
- 当我们提到 DutchBud 或金融科技时,许可的开放银行或法定现金取款幻想——虚拟信用和产品语言仅此而已。
总结
开放权重试验教会了我们不要贬低前沿桌脑。混合设计教会了我们不要将多 GPU 投资束之高阁,使其成为令人失望的博物馆。在 Grok Build 下,本地推理和 Grok API 不是争夺同一王位的对手。API 仍然是硬编码代理工作的导演。本地 GPU 盒子成为了一名批量工人——在牵引力方面是头等舱——可以在不牺牲使我们在八月欢呼的质量标准的情况下,将昂贵的 Grok API 量从发票中移除。
如果你在 LinkedIn 上争论本地模式与云模式,问一个更尖锐的问题:你的代理牵引是否将混合模式视为产品功能,还是周末脚本?我们的做法是前者。EPYC 和 3090 可以再次咆哮——在指导下。
发表回复