NVLink voor de rich cats, PCIe voor de rest — en Huawei opent de bus

geplaatst in: Uncategorized | 0

Toen NVIDIA NVLink van consumenten-GeForce-kaarten haalde vanaf de RTX 40-serie, klonk de marketing beleefd: die-oppervlak voor “AI-features,” gamers hebben geen multi-GPU-bridges nodig, PCIe 5.0 ×16 is “ruim genoeg.” Dat verhaal is incompleet. Wat er echt gebeurde is een productlijn-scheiding. Snelle GPU-naar-GPU-fabric bleef aan de enterprise-kant van de muur. Het thuislab, de indie-inference-box en de kleine hoster mochten “rommelen” op een host-bus die nooit is ontworpen als multi-accelerator-geheugenfabric.

Gesplitst beeld: gesloten enterprise GPU-interconnect versus open multi-accelerator-mesh
Twee interconnect-filosofieën: gesloten hogesnelheidsfabric voor de weinigen, open scale-out-bus voor de velen.

Wat NVLink was — en wie het nog krijgt

NVLink is een hogebandbreedte-, lage-latentie-verbinding tussen accelerators. Op eerdere GeForce high-end kaarten (onder meer de RTX 2080 Ti-klasse en de RTX 3090) konden enthousiastelingen nog twee boards bridgen en tensoren verplaatsen zonder elke byte door het PCIe-rootcomplex van de CPU te jagen. Met Ada Lovelace (RTX 40) verdwenen die connectors van GeForce. Blackwell-consumentenkaarten brachten ze niet terug. De bridge verdween niet van NVIDIA’s roadmap — hij verhuisde naar boven.

Aan de corporate kant bleef NVLink evolueren. Hopper- en Blackwell-datacenter-GPU’s zitten in NVLink-domeinen (HGX, DGX, GB200-achtige NVL-systemen) waar peer-bandbreedte in terabytes per seconde over een GPU-complex wordt gemeten, niet in de tientallen gigabytes per seconde die één PCIe 5.0 ×16-slot end-to-end onder echte protocol-overhead haalt. Dat is het verschil tussen:

  • Tensor-parallel inference en training die meerdere GPU’s als één min of meer geheugencoherent machine behandelen, en
  • PCIe-gebonden multi-GPU, waar elke cross-card gradient, KV-cache-shard of all-reduce vecht met de host-bus, de chipset en NUMA.

PCIe 5.0 ×16 is een prima upgrade voor één dikke GPU die met NVMe en NIC’s praat. Het is een slechte vervanger voor een dedicated accelerator-fabric als je wilt dat veel GPU’s als één brein werken. Dat “goed genoeg voor thuisgebruikers” noemen is geen generositeit. Het is marktsegmentatie met een glimlach.

De echte klant van NVLink 5

Enterprise-NVLink (inclusief de NVLink 5-generatie op Blackwell-klasse systemen) bestaat zodat hyperscalers, nationale labs en goed gefinancierde AI-bedrijven echte multi-GPU inference en training kunnen uitrollen: grote contexten, expert parallelism, strakke collectives, rack-scale “één logische GPU”-ontwerpen. Die kopers betalen voor SXM-modules, liquid cooling, NVIDIA-netwerken en softwarestacks die de fabric als gegeven aannemen.

Ondertussen hoort de bouwer met twee of vier GeForce-kaarten in een tower:

  1. Koop meer VRAM op één kaart (tot de MSRP op een autotermijn lijkt), of
  2. Accepteer PCIe als interconnect en kijk hoe utilization-grafieken liegen over “multi-GPU,” of
  3. Studeer af naar enterprise-SKU’s — als exportregels, stroom en budget meewerken.

Die ladder is geen ongeluk. Een gesloten, premium fabric maakt multi-accelerator-competentie tot een klassenmarker. De rich cats krijgen de bus. De rest krijgt een slot.

Als het snelle pad alleen op de offerte staat die een sales engineer vereist, is “AI democratiseren” een slide deck, geen productbeleid.

Huawei’s dwang — en de open tegenzet

Huawei’s situatie is anders en, botweg, harder. Geavanceerde process nodes en sommige westerse GPU-ecosystemen zijn beperkt. Je koopt je niet zomaar de gesloten ladder in. Dus deed het bedrijf iets dat zowel noodzakelijk als ingenieus is: investeren in scale-out interconnect en architectuur zodat veel NPU’s als één machine kunnen werken — SuperPoDs en SuperClusters — in plaats van te doen alsof één gesanctioneerde-node-chip alleen op piek-FLOPs wint.

Het protocol achter die push is UnifiedBus (UB). Atlas 900 A3 SuperPoD-deployments draaien al op UnifiedBus 1.0 op betekenisvolle klantschaal. Op HUAWEI CONNECT 2025 bracht Huawei de technische specificaties van UnifiedBus 2.0 uit en positioneerde die als open toegankelijk voor industriebartners: bus-grade interconnect, peer-to-peer coördinatie, resource pooling en een pad naar duizenden NPU’s als één logische computer. Nevenrichtingen omvatten UBoE (UnifiedBus over Ethernet) zodat clusters vertrouwde switching kunnen gebruiken waar dat past, naast het pure SuperPoD-fabric-verhaal.

Is dat pure altruïsme? Nee — en dat hoeft ook niet. Huawei heeft duidelijk gezegd dat AI-monetisatie op hardware blijft centreren, terwijl softwarestacks (CANN-interfaces, Mind-toolchains, foundation-model-lijnen op gestelde termijnen) en interconnect-specs opengaan om een ecosysteem te laten groeien. Noodzaak dwong de architecturale weddenschap; openheid is hoe je een beperkte supply chain omzet in een gedeelde standaard in plaats van een privé-kooi.

Dat is het tegenovergestelde instinct van het beste GPU-naar-GPU-pad achter enterprise-SKU’s zetten en de rest laten genieten van PCIe.

Mensen vs. rich cats — de interconnect-test

Beoordeel vendors op wie accelerators mag koppelen, niet op wie de flashiest single-die-demo stuurt.

NVIDIA consumentenpad NVIDIA enterprise-pad Huawei SuperPoD-pad
Snelle GPU/NPU-fabric Weg van GeForce (40-serie en verder) NVLink-generaties tot NVLink 5-domeinen UnifiedBus 1.0 → open UB 2.0-specs
Thuis / klein lab multi-accelerator PCIe 5.0 ×16 en hoop Niet de doel-SKU Architectuur gericht op veel chips als één machine
Voor wie de fabric optimaliseert “Rommelen” op de host-bus Corporate en cloud inference/training op schaal Partners die SuperPoD-klasse systemen bouwen op open specs
Openheid van het interconnect-verhaal Gesloten; GeForce afgesneden Gesloten product + software-moat UB 2.0-specs vrijgegeven voor industrie-adoptie

NVIDIA’s zet concentreert capaciteit waar de facturen het grootst zijn. Consumentensilicon traint nog LoRA’s en draait lokale chat — tot model, context of parallellisme een echte fabric nodig heeft. Dan is het plafond plotseling en duur.

Huawei’s zet, gedwongen door geopolitiek en process-limits, wijst nog steeds de andere kant op: kun je niet alleen winnen op de chique transistor, dan win je door veel competente accelerators aan elkaar te bedraden en genoeg van de bus te publiceren zodat anderen erop kunnen bouwen. Dat is infrastructuur voor een industrie, geen velvet rope om een club.

Zeg het hardop: Huawei speelt een people-scale interconnect-spel — open de bus, schaal de pod, monetiteer metaal. NVIDIA speelt een rich-cat fabric-spel — houd NVLink waar de CAPEX woont, en laat het thuisrack ontdekken dat PCIe een oprit is, geen snelweg.

Wat dit betekent als je echt host en systemen levert

Voor operators en bouwers die om soevereiniteit en kosten geven:

  • Verwar een GeForce-winkelwagen niet met een multi-GPU-architectuur. Twee mooie kaarten in één chassis zijn geen NVLink-domein.
  • Meet collectives en KV-verkeer, niet alleen tokens/sec op één device. De fabric zie je in de traces.
  • Volg open interconnect-specs (UnifiedBus 2.0 en eerlijke alternatieven). Standaarden die buiten één vendor’s premium-SKU-lijst overleven, houden kleinere spelers in het spel.
  • Plan stroom, koeling en software voor de bus die je écht kunt kopen — en wees eerlijk als de bus die je nodig hebt geblokkeerd is.

Slot

NVLink van RTX 40-klasse GeForce halen was geen cadeau van extra AI-transistors aan gamers. Het was een scherpe snede tussen hobby multi-GPU en productie multi-GPU. NVLink 5 en enterprise-neven bestaan zodat corporate buddies serieuze inference en training kunnen uitrollen. PCIe 5.0 ×16 is wat overblijft als je niet op die lijst staat.

Huawei, geblokkeerd van het makkelijke pad, open-documenteerde UnifiedBus 2.0 zodat zeer grote aantallen NPU’s als één systeem gekoppeld kunnen worden — noodzaak aangescherpt tot een ecosysteemweddenschap. De ene kant wallt het snelle pad af. De andere publiceert de bus.

Als “AI voor iedereen” meer is dan een keynote-slogan, is interconnect-beleid de tell. Kijk wie de fabric krijgt — en wie te horen krijgt dat het slot genoeg is.

Bouw of host je AI-infrastructuur en wil je een second opinion over fabric, stroom en ops-realiteit? Praat met 3DN.

Geef een reactie

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *