Lokale GPU-bulk MT: Tower-Plus op een 3090 verlaagt de grenskosten voor tokens voor 3DN en PolitiCap

geplaatst in: Uncategorized | 0

Deze middag hebben we een volledige taalgolf voltooid zonder een grens API-rekening te laten oplopen voor het bulkwerk: 22 3DN-berichten in het Engels naar het Chinees, en 37 PolitiCap-notities sinds 21 augustus naar het Nederlands. De machine die het werk deed, zit op het LAN — een NVIDIA RTX 3090 onder de naam Gaia — en draait Unbabel Tower-Plus-9B via Ollama als de Grok Build-pin gaia-tower.

Het hybride bureau in één zin

Grok 4.5 (frontier) bezit nog steeds het oordeel, de toon, SEO-weefsel en “is dit publiceerbaar?”. Lokale GPU bezit mechanische kopieën: verkennen/plannen van werknemers op Qwen 2.5 Coder 14B (gaia-gpu), en machinevertaling van artikelen op Tower-Plus (gaia-tower). Ouders blijven duur; bulk tokens blijven op VRAM die we al bezitten.

Kostenvergelijking frontier vs lokale Tower
Een batch: geschatte kosten van de frontier API vs elektriciteit op de 3090.

Wat er daadwerkelijk is uitgevoerd

  • 3dn.nl — Polylang kreeg zh; elke gepubliceerde Engelse post heeft nu een gekoppelde Chinese zuster.
  • politicap.eu — Polylang kreeg nl; elke Engelse draad vanaf 21 aug heeft een Nederlandse zuster. De volgorde van de schakelaar is EN | NL | 中文 | TH.
  • HTML-structuur, tickerverbindingen en merk symbolen bleven intact; alleen menselijke leesbare tekstknooppunten verplaatst.
Batch-tellingen ZH en NL
Tower-Plus-doorvoer voor deze run: 22 ZH + 37 NL artikelen.

Verdiensten wiskunde (deze batch)

Ruwe maar eerlijke orde van grootte voor ~400k tekens aan artikel HTML (titels + gedeelde lichamen, prompt overhead inbegrepen):

Lane Estimate
Frontier API als dezelfde bulk MT op Grok-klasse prijzen liep (~150k invoer + ~150k uitvoer tokens met chunk overhead) ≈ $8–15 (we boeken $12 gemiddeld)
Local Tower-Plus op RTX 3090 (~25–40 min muur, ~300–350 W GPU verbruik) ≈ 0,15 kWh · ~$0,02–0,04 elektriciteit
Opgespaard vanmiddag ≈ $12 op één wave

Dat is geen “gratis AI”. Het is tokenkosten verplaatst naar computing waar we al voor betalen als infrastructuur. Herhaal elke publicatiewave en het jaarlijkse aantal is interessant: een bureau dat wekelijks tweetalige/drie-talige berichten verzendt, kan viercijferige frontier-uitgaven van de creditcard houden terwijl de 3090 de rest van de dag warm blijft voor OCR (Typhoon) en coderingwerkers (Qwen).

Observeerbaarheid

Gaia’s Ollama-exporteur zit op het vloot Prometheus-pad (gaia_ollama_up, model-inventaris, VRAM-meters). Het hybride Grok Build-pad stoot OTEL uit in dezelfde stack; de hybride bureau-weergave van Grafana is waar we kijken naar lokale vs frontier-aandeel zodra het verkeer stroomt. Na een stroomstoring hebben we ook Ollama vergrendeld in een opstarttaak, zodat LAN-inferentie niet afhankelijk is van een open desktop-sessie.

Waarom dit past bij 3DN

Digitale soevereiniteit is niet alleen “welke cloud”. Het is de vraag of bulk-inferentie voor onze eigen eigendommen het gebouw moet verlaten. Beheerde hosting en codering-agent bureaus leven al op ons ijzer; bulk MT zit nu naast hen. Frontier Grok blijft de scherpe pen. De GPU is de drukpers.

Fintech-ruggengraat voor het gezin: goedkopere publicatie-operaties betekent meer bureaucapaciteit voor producten die geld verplaatsen — DutchBud bank, gesloten-loop credits en de burgermarkt rond PolitiCap — zonder te doen alsof we een gelicentieerde open-banking-provider zijn.

Grafana: hybrid Gaia GPU (live panels)

Screenshots from the live fleet dashboards via Grafana’s /render API (remote image renderer on the build host). Source boards: Grok Build · hybrid Gaia GPU and Grok CLI · queries & cost.

Grafana token rate by model
Token rate by model (parent Grok API vs Gaia local) — last 24h.
Grafana tokens in range by model
Tokens in range by model — last 7 days.
Grafana local share of tokens
Local share of Grok Build OTEL tokens (7d). Bulk Tower MT hits Ollama directly, so desk OTEL share stays low while Gaia GPU gauges still show the load.
Grafana Gaia GPU util and power
Gaia RTX 3090 — GPU utilization and power (24h).
Grafana Gaia VRAM
Gaia VRAM (Ollama loaded + nvidia used) — 24h.
Grafana estimated cost rate
Estimated cost rate by token type (Grok CLI cost board, 7d).

Geef een reactie

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *