NVLink สำหรับเสือรวย PCIe สำหรับที่เหลือ — และ Huawei เปิดบัส

posted in: Uncategorized | 0

เมื่อ NVIDIA ถอด NVLink ออกจากการ์ด GeForce ระดับผู้บริโภคตั้งแต่ซีรีส์ RTX 40 คำตลาดฟังสุภาพ: ใช้พื้นที่ไดย์กับ “ฟีเจอร์ AI,” เกมเมอร์ไม่ต้องการบริดจ์ multi-GPU, PCIe 5.0 ×16 “พอแล้ว” เรื่องนั้นไม่ครบ สิ่งที่เกิดจริงคือ การแบ่งไลน์ผลิตภัณฑ์ ผ้าเชื่อม GPU ความเร็วสูงยังอยู่ฝั่งองค์กร ห้องแล็บบ้าน กล่อง inference อิสระ และโฮสต์เล็ก ๆ ถูกชวนให้ “เล่น ๆ” บนบัสโฮสต์ที่ไม่ได้ถูกออกแบบมาเป็น fabric หน่วยความจำของหลายตัวเร่ง

ภาพคู่: อินเตอร์คอนเนคต์ GPU องค์กรแบบปิด กับตาข่ายตัวเร่งแบบเปิด
สองปรัชญาของอินเตอร์คอนเนคต์: fabric ความเร็วสูงแบบปิดเพื่อคนกลุ่มน้อย กับบัส scale-out แบบเปิดเพื่อคนจำนวนมาก

NVLink คืออะไร — และใครยังได้ใช้

NVLink คือลิงก์แบนด์วิดท์สูง หน่วงต่ำ ระหว่างตัวเร่ง บน GeForce ระดับสูงรุ่นก่อน (โดยเฉพาะกลุ่ม RTX 2080 Ti และ RTX 3090) นักเล่นยังบริดจ์สองบอร์ดแล้วส่งเทนเซอร์ได้โดยไม่ต้องทุบทุกไบต์ผ่าน PCIe root complex ของ CPU ด้วย Ada Lovelace (RTX 40) คอนเนกเตอร์เหล่านั้นหายจาก GeForce การ์ดผู้บริโภค Blackwell ก็ไม่เอากลับมา สะพานไม่ได้หายจากโรดแมปของ NVIDIA — มันย้ายขึ้นชั้นบน

ฝั่งองค์กร NVLink ยังพัฒนาต่อ GPU ศูนย์ข้อมูล Hopper และ Blackwell อยู่ในโดเมน NVLink (HGX, DGX, ระบบ NVL ตระกูล GB200) ที่แบนด์วิดท์เพียร์วัดเป็น เทราไบต์ต่อวินาที ข้ามคอมเพล็กซ์ GPU ไม่ใช่หลักสิบกิกะไบต์ต่อวินาทีที่สล็อต PCIe 5.0 ×16 หนึ่งช่องทำได้จริงภายใต้โอเวอร์เฮดโปรโตคอล นั่นคือความต่างระหว่าง:

  • อินเฟอเรนซ์และการเทรนแบบ tensor-parallel ที่มองหลาย GPU เป็นเครื่องที่ใกล้เคียง memory-coherent เครื่องเดียว และ
  • multi-GPU ที่ติด PCIe ที่ทุก gradient ข้ามการ์ด, เศษ KV-cache หรือ all-reduce ต้องสู้กับบัสโฮสต์ ชิปเซ็ต และ NUMA

PCIe 5.0 ×16 เป็นอัปเกรดที่ดีสำหรับ GPU ตัวใหญ่ตัวเดียวคุยกับ NVMe และ NIC แต่มันทดแทน fabric ตัวเร่งเฉพาะทางได้แย่เมื่อต้องการให้ GPU หลายตัว ทำงานเหมือนสมองเดียว การบอกว่า “พอสำหรับผู้ใช้บ้าน” ไม่ใช่ความใจกว้าง มันคือ การแบ่งตลาดที่ยิ้มให้

ลูกค้าตัวจริงของ NVLink 5

NVLink ระดับองค์กร (รวมรุ่น NVLink 5 บนระบบตระกูล Blackwell) มีอยู่เพื่อให้ไฮเปอร์สเกลเลอร์ แล็บแห่งชาติ และบริษัท AI ทุนหนา ติดตั้ง อินเฟอเรนซ์และการเทรน multi-GPU จริง: คอนเท็กซ์ใหญ่, expert parallelism, collectives แน่น, ออกแบบ “GPU ตรรกะเครื่องเดียว” ระดับแร็ค คนซื้อพวกนั้นจ่ายโมดูล SXM, ระบายความร้อนเหลว, เครือข่าย NVIDIA และซอฟต์แวร์ที่สมมติว่า fabric มีอยู่แล้ว

ขณะที่คนประกอบเครื่องสองหรือสี่การ์ด GeForce ในทาวเวอร์ได้ยินว่าอนาคตคือ:

  1. ซื้อ VRAM บนการ์ดใบเดียวให้มากขึ้น (จนกว่า MSRP จะเหมือนค่างวดรถ) หรือ
  2. ยอมรับ PCIe เป็นอินเตอร์คอนเนคต์ แล้วดูกราฟ utilization โกหกเรื่อง “multi-GPU” หรือ
  3. เลื่อนชั้นไป SKU องค์กร — ถ้ากฎส่งออก ไฟ และงบอนุญาต

บันไดนั้นไม่ใช่อุบัติเหตุ fabric ปิดระดับพรีเมียมทำให้ความสามารถ multi-accelerator กลายเป็น เครื่องหมายชนชั้น เสือรวยได้บัส ที่เหลือได้สล็อต

เมื่อทางด่วนมีเฉพาะบนใบเสนอราคาที่ต้องมีเซลล์วิศวกร “ทำให้ AI เป็นของทุกคน” คือสไลด์ ไม่ใช่นโยบายผลิตภัณฑ์

ข้อจำกัดของ Huawei — และการโต้กลับแบบเปิด

สถานการณ์ของ Huawei ต่างและพูดตรง ๆ ว่าโหดกว่า โหนดกระบวนการขั้นสูงและระบบนิเวศ GPU ตะวันตกบางส่วนถูกจำกัด คุณซื้อบันไดปิดแบบเดิมไม่ได้ง่าย ๆ บริษัทจึงทำสิ่งที่ทั้ง จำเป็นและฉลาด: ลงทุนอินเตอร์คอนเนคต์ scale-out และสถาปัตยกรรมให้ NPU จำนวนมาก ทำงานเป็นเครื่องเดียว — SuperPoD และ SuperCluster — แทนการแกล้งว่าชิปโหนดเดียวภายใต้มาตรการจะชนะด้วย FLOPs สูงสุดอย่างเดียว

โปรโตคอลหลังแรงผลักนั้นคือ UnifiedBus (UB) การติดตั้ง Atlas 900 A3 SuperPoD ใช้ UnifiedBus 1.0 ในสเกลลูกค้าจริงแล้ว ที่ HUAWEI CONNECT 2025 Huawei เปิดสเปกเทคนิค UnifiedBus 2.0 และวางให้คู่ค้าอุตสาหกรรมเข้าถึงได้: อินเตอร์คอนเนคต์ระดับบัส, ประสาน peer-to-peer, รวมทรัพยากร และทางไปสู่ NPU หลายพันตัวเป็นคอมพิวเตอร์ตรรกะเครื่องเดียว ทิศทางคู่ขนานรวม UBoE (UnifiedBus over Ethernet) ให้คลัสเตอร์ใช้สวิตช์ที่คุ้นเคยได้เมื่อเหมาะสม ควบคู่เรื่อง fabric SuperPoD บริสุทธิ์

นั่นคือความใจบุญล้วน ๆ ไหม? ไม่ — และไม่จำเป็นต้องเป็น Huawei บอกชัดว่าการทำเงินจาก AI ยังโฟกัสที่ ฮาร์ดแวร์ ขณะเปิดสแต็กซอฟต์แวร์ (อินเทอร์เฟซ CANN, ชุด Mind, ไลน์ foundation model ตามไทม์ไลน์ที่ประกาศ) และสเปกอินเตอร์คอนเนคต์เพื่อปลูกระบบนิเวศ ความจำเป็นบังคับเดิมพันสถาปัตยกรรม ความเปิดคือวิธีเปลี่ยนซัพพลายเชนที่ถูกบีบให้เป็น มาตรฐานร่วม แทนกรงส่วนตัว

นั่นตรงข้ามสัญชาตญาณของการล็อกเส้นทาง GPU-to-GPU ที่ดีที่สุดไว้หลัง SKU องค์กร แล้วบอกคนอื่นให้สนุกกับ PCIe

ประชาชน vs. เสือรวย — บททดสอบอินเตอร์คอนเนคต์

ตัดสินผู้ขายจากว่าใครได้ เชื่อม ตัวเร่ง ไม่ใช่ใครส่งเดโมไดย์เดี่ยวที่วับวาวที่สุด

เส้นทางผู้บริโภค NVIDIA เส้นทางองค์กร NVIDIA เส้นทาง SuperPoD ของ Huawei
Fabric GPU/NPU เร็ว ถอดจาก GeForce (40 ขึ้นไป) รุ่น NVLink ถึงโดเมน NVLink 5 UnifiedBus 1.0 → สเปก UB 2.0 แบบเปิด
บ้าน / แล็บเล็ก multi-accelerator PCIe 5.0 ×16 กับความหวัง ไม่ใช่ SKU เป้าหมาย สถาปัตยกรรมมุ่งหลายชิปเป็นเครื่องเดียว
fabric เหมาะกับใคร “เล่น ๆ” บนบัสโฮสต์ อินเฟอเรนซ์/เทรนองค์กรและคลาวด์สเกลใหญ่ คู่ค้าสร้างระบบระดับ SuperPoD บนสเปกเปิด
ความเปิดของเรื่องอินเตอร์คอนเนคต์ ปิด; ตัด GeForce ผลิตภัณฑ์ปิด + คูเมืองซอฟต์แวร์ ปล่อยสเปก UB 2.0 ให้ภาคอุตสาหกรรมรับ

หมากของ NVIDIA รวมความสามารถไว้ที่ใบแจ้งหนี้ก้อนใหญ่ ซิลิคอนผู้บริโภคยังเทรน LoRA และรันแชทโลคัลได้ — จนโมเดล คอนเท็กซ์ หรือ parallelism ต้องการ fabric จริง แล้วเพดานก็มาเร็วและแพง

หมากของ Huawei ถูกบังคับด้วยภูมิรัฐศาสตร์และขีดจำกัดกระบวนการ ยังชี้ทางตรงข้าม: ถ้าชนะด้วยทรานซิสเตอร์หรูอย่างเดียวไม่ได้ ก็ชนะด้วยการ เดินสายตัวเร่งที่มีฝีมือจำนวนมากเข้าด้วยกัน แล้วเผยแพร่บัสพอให้คนอื่นสร้างต่อได้ นั่นคือโครงสร้างพื้นฐานของอุตสาหกรรม ไม่ใช่เชือกกำมะหยี่กั้นคลับ

พูดตรง ๆ: Huawei เล่นเกมอินเตอร์คอนเนคต์สเกลประชาชน — เปิดบัส ขยายพอด ทำเงินจากโลหะ NVIDIA เล่นเกม fabric ของเสือรวย — เก็บ NVLink ไว้ที่ CAPEX หนา แล้วให้แร็คบ้านเรียนรู้ว่า PCIe คือทางเข้าบ้าน ไม่ใช่ทางด่วน

ความหมายถ้าคุณโฮสต์และส่งมอบระบบจริง

สำหรับผู้ดูแลระบบและผู้สร้างที่ใส่ใจอธิปไตยและต้นทุน:

  • อย่าสับสนรถเข็น GeForce กับสถาปัตยกรรม multi-GPU การ์ดสวยสองใบในแชสซีเดียวไม่ใช่โดเมน NVLink
  • วัด collectives และการเคลื่อน KV ไม่ใช่แค่ tokens/sec บนอุปกรณ์เดียว fabric โผล่ในเทรซ
  • จับตาสเปกอินเตอร์คอนเนคต์เปิด (UnifiedBus 2.0 และทางเลือกที่ซื่อสัตย์) มาตรฐานที่รอดนอกบัญชี SKU พรีเมียมของผู้ขายรายเดียว คือทางให้ผู้เล่นเล็กอยู่ต่อในเกม
  • วางแผนไฟ ความเย็น และซอฟต์แวร์ สำหรับบัสที่ซื้อได้จริง — และซื่อสัตย์เมื่อบัสที่ต้องการถูกกั้น

ปิดท้าย

การถอด NVLink จาก GeForce ตระกูล RTX 40 ไม่ใช่ของขวัญทรานซิสเตอร์ AI เพิ่มให้เกมเมอร์ มันคือการตัดชัดระหว่าง multi-GPU งานอดิเรก กับ multi-GPU โปรดักชัน NVLink 5 และพี่น้ององค์กรมีอยู่เพื่อให้เพื่อนองค์กรติดตั้งอินเฟอเรนซ์และการเทรนจริงจัง PCIe 5.0 ×16 คือสิ่งที่เหลือเมื่อคุณไม่อยู่ในรายชื่อนั้น

Huawei ที่ถูกปิดทางง่าย เปิดเอกสาร UnifiedBus 2.0 ให้เชื่อม NPU จำนวนมหาศาลเป็นระบบเดียว — ความจำเป็นถูกลับให้เป็นเดิมพันระบบนิเวศ ฝั่งหนึ่งก่อกำแพงทางด่วน อีกฝั่งเผยแพร่บัส

ถ้า “AI สำหรับทุกคน” มากกว่าสโลแกนคีย์โน้ต นโยบายอินเตอร์คอนเนคต์คือสัญญาณ ดูว่าใครได้ fabric — และใครถูกบอกว่าสล็อตก็พอ

สร้างหรือโฮสต์โครงสร้างพื้นฐาน AI และอยากได้ความเห็นที่สองเรื่อง fabric ไฟ และความจริงของ ops? คุยกับ 3DN

ใส่ความเห็น

อีเมลของคุณจะไม่แสดงให้คนอื่นเห็น ช่องข้อมูลจำเป็นถูกทำเครื่องหมาย *