本地 GPU 批量 MT:3090 上的 Tower-Plus 降低了 3DN 和 PolitiCap 的 Frontier 代币成本

posted in: Uncategorized | 0

今天下午,我们在不使用大量工作的前沿 API 费用的情况下,完成了完整的语言波:将 22 篇英文 3DN 文章翻译成中文,以及自 8 月 21 日以来的 37 篇 PolitiCap 桌面笔记翻译成荷兰语。执行翻译的机器位于局域网中——一台名为Gaia的 NVIDIA RTX 3090,通过 Ollama 运行 Unbabel Tower-Plus-9B,Grok Build 标记为 gaia-tower

一句话概括混合桌面

Grok 4.5 (前沿) 仍然拥有判断、语气、SEO 编织和“是否可以发布”的权利。本地 GPU 拥有机械副本:在 Qwen 2.5 Coder 14B (gaia-gpu) 上探索/计划工人,以及在 Tower-Plus (gaia-tower) 上进行文章机器翻译。父母仍然很贵;大量代币仍然在我们已经拥有的 VRAM 上。

Cost comparison frontier vs local Tower
一批:估计的前沿 API 成本与 3090 的电力成本。

实际运行情况

  • 3dn.nl — Polylang 获得了 zh;现在每个发布的英文文章都有一个链接的中文姐妹篇。
  • politicap.eu — Polylang 获得了 nl;从 8 月 21 日起,每个英文电报都有一个荷兰语姐妹篇。切换顺序为 EN | NL | 中文 | TH。
  • HTML 结构、股票链接和品牌符号保持不变;只有可读文本节点移动。
Batch counts ZH and NL
此轮运行的 Tower-Plus 吞吐量:22 篇 ZH + 37 篇 NL 文章。

收益数学(此批次)

对 ~400k 个文章 HTML 字符的粗略但诚实的数量级(标题 + 分块正文,包括提示开销):

通道 估算
如果使用相同的批量 MT 在 Grok 级别定价上运行(~150k 输入 + ~150k 输出令牌,包含块开销),则 Frontier API ≈ $8–15(我们预订 $12 中位数)
在 RTX 3090 上运行本地 Tower-Plus(~25–40 分钟墙,~300–350 W GPU 功耗) ≈ 0.15 kWh · ~$0.02–0.04 电力
今天下午节省 ≈ $12 每次波

这不是“免费的人工智能”。它是将 令牌成本 转移到我们已经为基础设施支付的 计算 上。每次发布波重复,年度数字才是有趣的:一个每周发布双语/三语帖子的桌面可以将四位数的前沿支出从信用卡中扣除,同时 3090 可以在一天的剩余时间内为 OCR(台风)和编码工人(Qwen)保持温暖。

可观察性

Gaia 的 Ollama 导出器位于车队 Prometheus 路径上(gaia_ollama_up,模型库存,VRAM 指表)。混合 Grok 构建路径将 OTEL 发射到同一堆栈中;Grafana 的混合桌面视图是我们观察本地与前沿份额的地方,一旦流量开始流动。在电源闪变后,我们还将 Ollama 锁定为一个启动任务,以便 LAN 推理不依赖于桌面会话保持打开。

为什么这适合 3DN

数字主权不仅仅是“哪个云”。它是指我们自己的属性的大规模推理是否必须离开建筑物。托管和编码代理桌面已经在我们的铁上运行;大规模 MT 现在就坐在它们旁边。Frontier Grok 仍然是尖刀。GPU 是印刷机。

家庭金融支柱:更便宜的发布操作意味着更多的桌面容量用于移动资金的产品——DutchBud 银行、闭环信用和 PolitiCap 周围的公民市场——而不假装我们是持牌开放银行提供商。

Grafana: hybrid Gaia GPU (live panels)

Screenshots from the live fleet dashboards via Grafana’s /render API (remote image renderer on the build host). Source boards: Grok Build · hybrid Gaia GPU and Grok CLI · queries & cost.

Grafana token rate by model
Token rate by model (parent Grok API vs Gaia local) — last 24h.
Grafana tokens in range by model
Tokens in range by model — last 7 days.
Grafana local share of tokens
Local share of Grok Build OTEL tokens (7d). Bulk Tower MT hits Ollama directly, so desk OTEL share stays low while Gaia GPU gauges still show the load.
Grafana Gaia GPU util and power
Gaia RTX 3090 — GPU utilization and power (24h).
Grafana Gaia VRAM
Gaia VRAM (Ollama loaded + nvidia used) — 24h.
Grafana estimated cost rate
Estimated cost rate by token type (Grok CLI cost board, 7d).

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注