NVLink สำหรับเสือรวย PCIe สำหรับที่เหลือ — และ Huawei เปิดบัส

เมื่อ NVIDIA ถอด NVLink ออกจากการ์ด GeForce ระดับผู้บริโภคตั้งแต่ซีรีส์ RTX 40 คำตลาดฟังสุภาพ: ใช้พื้นที่ไดย์กับ “ฟีเจอร์ AI,” เกมเมอร์ไม่ต้องการบริดจ์ multi-GPU, PCIe 5.0 ×16 “พอแล้ว” เรื่องนั้นไม่ครบ สิ่งที่เกิดจริงคือ การแบ่งไลน์ผลิตภัณฑ์ ผ้าเชื่อม GPU ความเร็วสูงยังอยู่ฝั่งองค์กร ห้องแล็บบ้าน กล่อง inference อิสระ และโฮสต์เล็ก ๆ ถูกชวนให้ “เล่น ๆ” บนบัสโฮสต์ที่ไม่ได้ถูกออกแบบมาเป็น fabric หน่วยความจำของหลายตัวเร่ง

ภาพคู่: อินเตอร์คอนเนคต์ GPU องค์กรแบบปิด กับตาข่ายตัวเร่งแบบเปิด
สองปรัชญาของอินเตอร์คอนเนคต์: fabric ความเร็วสูงแบบปิดเพื่อคนกลุ่มน้อย กับบัส scale-out แบบเปิดเพื่อคนจำนวนมาก

NVLink คืออะไร — และใครยังได้ใช้

NVLink คือลิงก์แบนด์วิดท์สูง หน่วงต่ำ ระหว่างตัวเร่ง บน GeForce ระดับสูงรุ่นก่อน (โดยเฉพาะกลุ่ม RTX 2080 Ti และ RTX 3090) นักเล่นยังบริดจ์สองบอร์ดแล้วส่งเทนเซอร์ได้โดยไม่ต้องทุบทุกไบต์ผ่าน PCIe root complex ของ CPU ด้วย Ada Lovelace (RTX 40) คอนเนกเตอร์เหล่านั้นหายจาก GeForce การ์ดผู้บริโภค Blackwell ก็ไม่เอากลับมา สะพานไม่ได้หายจากโรดแมปของ NVIDIA — มันย้ายขึ้นชั้นบน

ฝั่งองค์กร NVLink ยังพัฒนาต่อ GPU ศูนย์ข้อมูล Hopper และ Blackwell อยู่ในโดเมน NVLink (HGX, DGX, ระบบ NVL ตระกูล GB200) ที่แบนด์วิดท์เพียร์วัดเป็น เทราไบต์ต่อวินาที ข้ามคอมเพล็กซ์ GPU ไม่ใช่หลักสิบกิกะไบต์ต่อวินาทีที่สล็อต PCIe 5.0 ×16 หนึ่งช่องทำได้จริงภายใต้โอเวอร์เฮดโปรโตคอล นั่นคือความต่างระหว่าง:

  • อินเฟอเรนซ์และการเทรนแบบ tensor-parallel ที่มองหลาย GPU เป็นเครื่องที่ใกล้เคียง memory-coherent เครื่องเดียว และ
  • multi-GPU ที่ติด PCIe ที่ทุก gradient ข้ามการ์ด, เศษ KV-cache หรือ all-reduce ต้องสู้กับบัสโฮสต์ ชิปเซ็ต และ NUMA

PCIe 5.0 ×16 เป็นอัปเกรดที่ดีสำหรับ GPU ตัวใหญ่ตัวเดียวคุยกับ NVMe และ NIC แต่มันทดแทน fabric ตัวเร่งเฉพาะทางได้แย่เมื่อต้องการให้ GPU หลายตัว ทำงานเหมือนสมองเดียว การบอกว่า “พอสำหรับผู้ใช้บ้าน” ไม่ใช่ความใจกว้าง มันคือ การแบ่งตลาดที่ยิ้มให้

ลูกค้าตัวจริงของ NVLink 5

NVLink ระดับองค์กร (รวมรุ่น NVLink 5 บนระบบตระกูล Blackwell) มีอยู่เพื่อให้ไฮเปอร์สเกลเลอร์ แล็บแห่งชาติ และบริษัท AI ทุนหนา ติดตั้ง อินเฟอเรนซ์และการเทรน multi-GPU จริง: คอนเท็กซ์ใหญ่, expert parallelism, collectives แน่น, ออกแบบ “GPU ตรรกะเครื่องเดียว” ระดับแร็ค คนซื้อพวกนั้นจ่ายโมดูล SXM, ระบายความร้อนเหลว, เครือข่าย NVIDIA และซอฟต์แวร์ที่สมมติว่า fabric มีอยู่แล้ว

ขณะที่คนประกอบเครื่องสองหรือสี่การ์ด GeForce ในทาวเวอร์ได้ยินว่าอนาคตคือ:

  1. ซื้อ VRAM บนการ์ดใบเดียวให้มากขึ้น (จนกว่า MSRP จะเหมือนค่างวดรถ) หรือ
  2. ยอมรับ PCIe เป็นอินเตอร์คอนเนคต์ แล้วดูกราฟ utilization โกหกเรื่อง “multi-GPU” หรือ
  3. เลื่อนชั้นไป SKU องค์กร — ถ้ากฎส่งออก ไฟ และงบอนุญาต

บันไดนั้นไม่ใช่อุบัติเหตุ fabric ปิดระดับพรีเมียมทำให้ความสามารถ multi-accelerator กลายเป็น เครื่องหมายชนชั้น เสือรวยได้บัส ที่เหลือได้สล็อต

เมื่อทางด่วนมีเฉพาะบนใบเสนอราคาที่ต้องมีเซลล์วิศวกร “ทำให้ AI เป็นของทุกคน” คือสไลด์ ไม่ใช่นโยบายผลิตภัณฑ์

ข้อจำกัดของ Huawei — และการโต้กลับแบบเปิด

สถานการณ์ของ Huawei ต่างและพูดตรง ๆ ว่าโหดกว่า โหนดกระบวนการขั้นสูงและระบบนิเวศ GPU ตะวันตกบางส่วนถูกจำกัด คุณซื้อบันไดปิดแบบเดิมไม่ได้ง่าย ๆ บริษัทจึงทำสิ่งที่ทั้ง จำเป็นและฉลาด: ลงทุนอินเตอร์คอนเนคต์ scale-out และสถาปัตยกรรมให้ NPU จำนวนมาก ทำงานเป็นเครื่องเดียว — SuperPoD และ SuperCluster — แทนการแกล้งว่าชิปโหนดเดียวภายใต้มาตรการจะชนะด้วย FLOPs สูงสุดอย่างเดียว

โปรโตคอลหลังแรงผลักนั้นคือ UnifiedBus (UB) การติดตั้ง Atlas 900 A3 SuperPoD ใช้ UnifiedBus 1.0 ในสเกลลูกค้าจริงแล้ว ที่ HUAWEI CONNECT 2025 Huawei เปิดสเปกเทคนิค UnifiedBus 2.0 และวางให้คู่ค้าอุตสาหกรรมเข้าถึงได้: อินเตอร์คอนเนคต์ระดับบัส, ประสาน peer-to-peer, รวมทรัพยากร และทางไปสู่ NPU หลายพันตัวเป็นคอมพิวเตอร์ตรรกะเครื่องเดียว ทิศทางคู่ขนานรวม UBoE (UnifiedBus over Ethernet) ให้คลัสเตอร์ใช้สวิตช์ที่คุ้นเคยได้เมื่อเหมาะสม ควบคู่เรื่อง fabric SuperPoD บริสุทธิ์

นั่นคือความใจบุญล้วน ๆ ไหม? ไม่ — และไม่จำเป็นต้องเป็น Huawei บอกชัดว่าการทำเงินจาก AI ยังโฟกัสที่ ฮาร์ดแวร์ ขณะเปิดสแต็กซอฟต์แวร์ (อินเทอร์เฟซ CANN, ชุด Mind, ไลน์ foundation model ตามไทม์ไลน์ที่ประกาศ) และสเปกอินเตอร์คอนเนคต์เพื่อปลูกระบบนิเวศ ความจำเป็นบังคับเดิมพันสถาปัตยกรรม ความเปิดคือวิธีเปลี่ยนซัพพลายเชนที่ถูกบีบให้เป็น มาตรฐานร่วม แทนกรงส่วนตัว

นั่นตรงข้ามสัญชาตญาณของการล็อกเส้นทาง GPU-to-GPU ที่ดีที่สุดไว้หลัง SKU องค์กร แล้วบอกคนอื่นให้สนุกกับ PCIe

กำแพงหน่วยความจำน่ากลัวกว่าการแข่งย่อโหนด

โครงสร้างลูกบาศก์มหึมาในอวกาศมืด — สื่อถึง memory-compute แบบซ้อนชั้น
กลืนกินด้วยแบนด์วิดท์: เมื่อคอมพิวเตอร์แซงหน่วยความจำ ลูกบาศก์ที่ชนะคือตัวที่เลี้ยงคอร์ได้ — ไม่ใช่แค่ตัวที่ย่อคอร์ให้เล็ก

การเมืองอินเตอร์คอนเนคต์สำคัญ ใต้ทั้ง NVLink และ UnifiedBus ยังมีสิ่งพื้นฐานกว่า: memory wall (กำแพงหน่วยความจำ)

หลายปีที่เรื่องเล่าของอุตสาหกรรมคือการย่อขนาด — ทรานซิสเตอร์เล็กลง ลอจิกหนาแน่นขึ้น FLOPs ต่อวัตต์บนสไลด์สูงขึ้น การแข่งนั้นจริงและแพง แต่งาน AI สมัยใหม่มักไม่ติดที่ว่า MAC น่ารักแค่ไหน แต่ติดที่ จะส่ง weights, activations และ KV cache ไปยังหน่วยคำนวณที่กำลังหิวโหยได้เร็วแค่ไหน ไดย์คำนวณเจ๋ง ๆ ที่ดูด DRAM ผ่านหลอดดูดเล็ก ๆ คือ Borg cube ที่ไม่มีสายไฟ: เงาหลอน ข้างในว่าง

กำแพงมีหลายชั้น:

  • DRAM นอกแพ็กเกจ — HBM ช่วย แต่ความจุและช่องทางยังจำกัดการออกแบบ
  • SRAM บนแพ็กเกจและบนไดย์ — เร็ว เล็กจิ๋ว และไม่เคยใหญ่พอสำหรับคอนเท็กซ์ frontier เพียงอย่างเดียว
  • เส้นทางชิปถึงชิปและโฮสต์ — PCIe, CXL และแม้ fabric GPU พรีเมียม กลายเป็นหลอดดูดถัดไปเมื่อหน่วยความจำท้องถิ่นหมด

คุณอาจชนะการแข่งโหนดแล้วยังแพ้งาน ถ้าทุกโทเคนต้องจ่ายภาษีหน่วยความจำ ฉะนั้น “แค่ย่อโพรเซส” จึงเป็นกลยุทธ์ไม่ครบสำหรับอินเฟอเรนซ์สเกลใหญ่ — และแรงกดดันส่งออกต่อลิโทกราฟีขั้นสูงจึงไม่แช่แข็งทุกคนที่ ซ้อนชั้น เจาะ via และเดินสายหน่วยความจำข้างคอมพิวเตอร์ได้ โดยอัตโนมัติ

งานแพ็กเกจและการรวมสามมิติของจีน — รวมการใช้ TSV (through-silicon via) อย่างจริงจัง และ การซ้อนชิปหลายชั้น — เล็งตรงกำแพงนั้น เส้นทางแนวตั้งสั้นแทนการเดินทางแนวนอนยาวข้ามแพ็กเกจหรือบอร์ด ลอจิกกับหน่วยความจำ (หรือหลายชั้นลอจิก) อยู่ในปริมาตร ไม่ใช่บนไปรษณียบัตร แบนด์วิดท์และพลังงานต่อบิตดีขึ้น เพราะฟิสิกส์ของ via ผ่านซิลิคอนซ้อนชั้นใจดีกว่าการวิ่งออกไป DRAM ไกล ๆ บนเส้นทางเดิม อีกครั้ง ถ้าทำดี stacking ไม่ได้แค่ประดับความล้าหลังของโหนดโพรเซส — มัน เลี่ยงเรขาคณิตที่เลวร้ายที่สุดของ memory wall ได้ในแบบที่การย่อแบบระนาบอย่างเดียวทำไม่ได้

นั่นอาจพื้นฐานกว่าการโม้ nanometer ถัดไป การย่อขนาดยังสำคัญต่อความหนาแน่นและกำลังไฟ แต่ถ้าคอขวดคือการเลี้ยงคอร์ ลูกบาศก์ที่น่ากลัวไม่ใช่ “ใครมีเกตเล็กสุด” แต่คือ ใครสร้างสิ่งมีชีวิต memory-compute ที่เป็นก้อนพอ ให้คอร์ไม่ต้องรอ บัส scale-out แบบเปิด (UnifiedBus และเครือญาติ) โจมตีกำแพงระหว่างแพ็กเกจกับแร็ค TSV stacking โจมตีกำแพงในแพ็กเกจ รวมกันแล้วเป็นทฤษฎีชัยชนะคนละแบบกับ “มีแต่เสือรวยได้ NVLink และมีแต่โหนดเล็กสุดได้อยู่ในเกม”

โรดแมปตะวันตกก็รู้เรื่องนี้ — กอง HBM, advanced packaging และระบบหนัก fabric คือคำตอบ memory wall คนละแบรนด์ จุดไม่ใช่ชาตินิยมในฐานะฟิสิกส์ จุดคือลำดับความสำคัญ: เมื่อการเคลื่อนหน่วยความจำครองเกม stacking กับการเดินสาย multi-accelerator แบบเปิดอาจสำคัญกว่าลัทธิย่อขนาดล้วน ๆ — โดยเฉพาะผู้เล่นที่ซื้อสลาก EUV ล่าสุดทุกปีไม่ได้

ประชาชน vs. เสือรวย — บททดสอบอินเตอร์คอนเนคต์

ตัดสินผู้ขายจากว่าใครได้ เชื่อม ตัวเร่ง ไม่ใช่ใครส่งเดโมไดย์เดี่ยวที่วับวาวที่สุด

เส้นทางผู้บริโภค NVIDIA เส้นทางองค์กร NVIDIA เส้นทาง SuperPoD ของ Huawei
Fabric GPU/NPU เร็ว ถอดจาก GeForce (40 ขึ้นไป) รุ่น NVLink ถึงโดเมน NVLink 5 UnifiedBus 1.0 → สเปก UB 2.0 แบบเปิด
บ้าน / แล็บเล็ก multi-accelerator PCIe 5.0 ×16 กับความหวัง ไม่ใช่ SKU เป้าหมาย สถาปัตยกรรมมุ่งหลายชิปเป็นเครื่องเดียว
fabric เหมาะกับใคร “เล่น ๆ” บนบัสโฮสต์ อินเฟอเรนซ์/เทรนองค์กรและคลาวด์สเกลใหญ่ คู่ค้าสร้างระบบระดับ SuperPoD บนสเปกเปิด
ความเปิดของเรื่องอินเตอร์คอนเนคต์ ปิด; ตัด GeForce ผลิตภัณฑ์ปิด + คูเมืองซอฟต์แวร์ ปล่อยสเปก UB 2.0 ให้ภาคอุตสาหกรรมรับ

หมากของ NVIDIA รวมความสามารถไว้ที่ใบแจ้งหนี้ก้อนใหญ่ ซิลิคอนผู้บริโภคยังเทรน LoRA และรันแชทโลคัลได้ — จนโมเดล คอนเท็กซ์ หรือ parallelism ต้องการ fabric จริง แล้วเพดานก็มาเร็วและแพง

หมากของ Huawei ถูกบังคับด้วยภูมิรัฐศาสตร์และขีดจำกัดกระบวนการ ยังชี้ทางตรงข้าม: ถ้าชนะด้วยทรานซิสเตอร์หรูอย่างเดียวไม่ได้ ก็ชนะด้วยการ เดินสายตัวเร่งที่มีฝีมือจำนวนมากเข้าด้วยกัน แล้วเผยแพร่บัสพอให้คนอื่นสร้างต่อได้ นั่นคือโครงสร้างพื้นฐานของอุตสาหกรรม ไม่ใช่เชือกกำมะหยี่กั้นคลับ

พูดตรง ๆ: Huawei เล่นเกมอินเตอร์คอนเนคต์สเกลประชาชน — เปิดบัส ขยายพอด ทำเงินจากโลหะ NVIDIA เล่นเกม fabric ของเสือรวย — เก็บ NVLink ไว้ที่ CAPEX หนา แล้วให้แร็คบ้านเรียนรู้ว่า PCIe คือทางเข้าบ้าน ไม่ใช่ทางด่วน

ความหมายถ้าคุณโฮสต์และส่งมอบระบบจริง

สำหรับผู้ดูแลระบบและผู้สร้างที่ใส่ใจอธิปไตยและต้นทุน:

  • อย่าสับสนรถเข็น GeForce กับสถาปัตยกรรม multi-GPU การ์ดสวยสองใบในแชสซีเดียวไม่ใช่โดเมน NVLink
  • วัด collectives และการเคลื่อน KV ไม่ใช่แค่ tokens/sec บนอุปกรณ์เดียว fabric โผล่ในเทรซ
  • จับตาสเปกอินเตอร์คอนเนคต์เปิด (UnifiedBus 2.0 และทางเลือกที่ซื่อสัตย์) มาตรฐานที่รอดนอกบัญชี SKU พรีเมียมของผู้ขายรายเดียว คือทางให้ผู้เล่นเล็กอยู่ต่อในเกม
  • วางแผนไฟ ความเย็น และซอฟต์แวร์ สำหรับบัสที่ซื้อได้จริง — และซื่อสัตย์เมื่อบัสที่ต้องการถูกกั้น

ปิดท้าย

การถอด NVLink จาก GeForce ตระกูล RTX 40 ไม่ใช่ของขวัญทรานซิสเตอร์ AI เพิ่มให้เกมเมอร์ มันคือการตัดชัดระหว่าง multi-GPU งานอดิเรก กับ multi-GPU โปรดักชัน NVLink 5 และพี่น้ององค์กรมีอยู่เพื่อให้เพื่อนองค์กรติดตั้งอินเฟอเรนซ์และการเทรนจริงจัง PCIe 5.0 ×16 คือสิ่งที่เหลือเมื่อคุณไม่อยู่ในรายชื่อนั้น

Huawei ที่ถูกปิดทางง่าย เปิดเอกสาร UnifiedBus 2.0 ให้เชื่อม NPU จำนวนมหาศาลเป็นระบบเดียว — ความจำเป็นถูกลับให้เป็นเดิมพันระบบนิเวศ ฝั่งหนึ่งก่อกำแพงทางด่วน อีกฝั่งเผยแพร่บัส

ถ้า “AI สำหรับทุกคน” มากกว่าสโลแกนคีย์โน้ต นโยบายอินเตอร์คอนเนคต์คือสัญญาณ ดูว่าใครได้ fabric — และใครถูกบอกว่าสล็อตก็พอ

สร้างหรือโฮสต์โครงสร้างพื้นฐาน AI และอยากได้ความเห็นที่สองเรื่อง fabric ไฟ และความจริงของ ops? คุยกับ 3DN

ใส่ความเห็น

อีเมลของคุณจะไม่แสดงให้คนอื่นเห็น ช่องข้อมูลจำเป็นถูกทำเครื่องหมาย *