Mellanox (NVIDIA Mellanox) MQM9790-NS2F Giải pháp kỹ thuật chuyển đổi InfiniBand

July 13, 2026

Mellanox (NVIDIA Mellanox) MQM9790-NS2F Giải pháp kỹ thuật chuyển đổi InfiniBand

Mellanox (NVIDIA Mellanox) MQM9790-NS2F Giải pháp kỹ thuật chuyển đổi InfiniBand

Sách trắng kỹ thuật này trình bày một kiến trúc giải pháp toàn diện tập trung vàoMellanox (NVIDIA Mellanox) MQM9790-NS2FInfiniBand switch. nhắm đến các kiến trúc sư mạng, kỹ sư bán hàng trước và các lãnh đạo hoạt động, tài liệu chi tiếtMQM9790-NS2Fcung cấp độ trễ cực thấp xác định, RDMA không mất mát và băng thông mở rộng cho cơ sở hạ tầng HPC và AI thế hệ tiếp theo.Thực hành tốt nhất, và xác nhận hiệu suất.

1. Xét nghiệm về dự án và các yêu cầu

Việc đào tạo AI hiện đại và khối lượng công việc mô phỏng khoa học đòi hỏi các vải mạng có thể duy trì các mô hình truyền thông toàn bộ giảm, toàn bộ thu thập và điểm đến điểm với sự rung chuyển dưới microsecond.Các giải pháp truyền thống dựa trên Ethernet, ngay cả với RoCEv2, đưa ra sự phức tạp trong quản lý tắc nghẽn, điều chỉnh PFC và kiểm soát độ trễ đuôi, thường dẫn đến việc sử dụng GPU không hiệu quả và thời gian hoàn thành công việc không thể đoán trước.

Các yêu cầu chính được xác định trên các dự án HPC / AI điển hình bao gồm:

  • Độ trễ từ đầu đến cuối < 1 μs (chuyển từ cổng sang cổng) dưới tải đầy đủ
  • Vải không mất mát với không rơi gói do tắc nghẽn
  • Tính mở rộng từ 64 đến hơn 2.000 nút GPU mà không có thay đổi kiến trúc
  • Hoạt động đơn giản hóa với số liệu từ xa và khôi phục lỗi tự động

CácNVIDIA Mellanox MQM9790-NS2Ftrực tiếp giải quyết các nhu cầu này bằng cách tích hợp công nghệ NDR 400 Gb / s, định tuyến thích nghi và tính toán trong mạng vào nền tảng OSFP 1U, 64 cổng.

2Thiết kế kiến trúc mạng / hệ thống chung

Kiến trúc được đề xuất sử dụng một cấu trúc hai tầng xương sống lá (hoặc cây mỡ) để cung cấp băng thông cắt ngang đầy đủ và độ bền cao. Mỗi khối lá bao gồm nhiều giá đỡ,với mỗi thùng chứa hai thùngChuyển đổi InfiniBand MQM9790-NS2FLớp xương sống tập hợp lưu lượng từ tất cả các công tắc lá, đảm bảo giao tiếp không chặn giữa hai điểm cuối.

CácMQM9790-NS2F 400Gb/s NDR 64-port OSFPchuyển đổi phục vụ như cả lá và cột sống, cung cấp phần cứng đồng nhất trên toàn bộ vải đơn giản hóa tiết kiệm và bảo trì.một thiết kế điển hình sử dụng 16 chuyển đổi lá (mỗi kết nối 64 GPU) và 8 chuyển đổi cột sống, tất cả được kết nối với nhau thông qua cáp quang hoặc DAC 400G. Vải hỗ trợ cả topology Fat-tree và Dragonfly +, với định tuyến thích nghi cân bằng động lưu lượng truy cập trên nhiều đường dẫn.

3Vai trò và đặc điểm chính củaMellanox (NVIDIA Mellanox) MQM9790-NS2Ftrong dung dịch

CácNVIDIA Mellanox MQM9790-NS2Flà nền tảng của giải pháp này, cung cấp:

  • 64 cổng OSFPmỗi hoạt động với tốc độ 400 Gb/s (NDR) ‡ tổng công suất chuyển mạch 25,6 Tb/s, với độ trễ cắt giảm dưới 600 ns.
  • Đường dẫn thích nghi- chọn năng động đường dẫn ít tắc nghẽn nhất cho mỗi gói, tránh các liên kết điểm nóng và duy trì độ trễ nhất quán ngay cả trong các mô hình giao thông không đối xứng.
  • SHARPv3 (Protocol tổng hợp và giảm phân cấp có thể mở rộng)- giảm tải về truyền thông tập thể (tất cả giảm, phát sóng) từ các CPU chủ, giảm trò chuyện mạng và tăng tốc đào tạo AI lên đến 20-30%.
  • Máy tính trong mạnghỗ trợ giảm dữ liệu, phân đoạn và thậm chí các hoạt động MPI quy mô nhỏ trực tiếp trên công tắc, giải phóng các tài nguyên GPU có giá trị cho tính toán.
  • Telemetry & Quản lý tắc nghẽn✓ giám sát nâng cao tích hợp bao gồm các bộ đếm theo dòng chảy, biểu đồ chiếm đóng đệm và số liệu độ trễ cấp đường dẫn, tất cả đều có thể xuất thông qua UFM hoặc REST API.

Những khả năng này cho phépMQM9790-NS2F Giải pháp chuyển đổi InfiniBandđể cung cấp hiệu suất xác định ở quy mô, được xác nhận bởi các điểm chuẩn nội bộ và triển khai của khách hàng.Thông số kỹ thuật MQM9790-NS2Fcũng bao gồm hỗ trợ cho cả DAC đồng thụ động và các mô-đun quang hoạt động, cung cấp tính linh hoạt cho khoảng cách lên đến 100 m (với quang học 400G SR4) và xa hơn.

4. Đề xuất triển khai và mở rộng quy mô (Topology điển hình)

Đối với việc triển khai khu vực xanh, chúng tôi khuyến cáo cách tiếp cận theo giai đoạn sau:

  • Giai đoạn 1Tham gia 2 công tắc lá (mỗiMQM9790-NS2F), và 2 công tắc cột sống, kết nối 128 GPU.MQM9790-NS2Fcác thông số.
  • Giai đoạn 2 ✓ Scale-out:Thêm các công tắc lá theo từng lần tăng 2 cho mỗi giá đỡ và các công tắc cột sống khi cần thiết để duy trì quá mức đăng ký ≤ 1:1Độ dày đặc cổng 64 cho phép một công tắc duy nhất lưu trữ một rack đầy đủ 64 nút GPU (nếu mỗi nút có một đường nối lên 400G duy nhất).
  • Giai đoạn 3 Multi-plane:Đối với các cụm vượt quá 2.000 nút, thực hiện nhiều vải độc lập (ví dụ: 2 × hoặc 4 × máy bay) với cân bằng tải dựa trên tuyến đường,Tận dụng hỗ trợ của switch cho các làn đường ảo và phím phân vùng.

Cáp thông thường sử dụng OSFP-to-OSFP DACs cho các kết nối trong giá đỡ (≤ 3 m) và các mô-đun quang OSFP-to-400G SR4 cho khoảng cách xương sống lên đến 100 m.MQM9790-NS2F tương thíchcác máy thu truyền được xác nhận với hệ sinh thái nhà cung cấp quang học NVIDIA, đảm bảo khả năng tương tác liền mạch.

5. Hoạt động, giám sát, chẩn đoán lỗi và tối ưu hóa

Hoạt động hiệu quả là rất quan trọng để duy trì độ trễ thấp trong sản xuất.NVIDIA UFM (Unified Fabric Manager), trong đó quy định:

  • Bảng điều khiển thời gian thực¢ băng thông mỗi cổng, bộ đếm lỗi và bản đồ nhiệt tắc nghẽn.
  • Tự động tối ưu hóa lại đường dẫnKhi một liên kết bị suy giảm hoặc thất bại, UFM tính toán lại tuyến đường và cấu hình lại bảng định tuyến thích nghi mà không cần sự can thiệp của nhà khai thác.
  • Điện đo lịch sử- lưu trữ dữ liệu trễ và luồng để phân tích sau khi chết và lập kế hoạch năng lực.

Dòng công việc khắc phục sự cố được đề nghị:

  1. Kiểm tra khung tạm dừng và loại bỏ mỗi cổng: không có loại bỏ; bất kỳ loại bỏ nào cũng cho thấy cấu hình sai hoặc quang học bị lỗi.
  2. Xác nhận hoạt động SHARPv3 thông qua thống kê tập thể của UFM.
  3. Sử dụng các công cụ chẩn đoán tích hợp (ví dụ:ibdiagnet,ibstatus) để kiểm tra tính toàn vẹn liên kết và tính toàn vẹn tín hiệu.

Để tối ưu hóa, điều chỉnh ngưỡng thuật toán định tuyến thích nghi (ví dụ, khoảng thời gian cảm nhận tải) dựa trên các mô hình khối lượng công việcMQM9790-NS2F InfiniBand switchcho phép tinh chỉnh thông qua giao diện quản lý. Cập nhật phần mềm thường xuyên (có sẵn thông qua cổng hỗ trợ của NVIDIA) bao gồm cải tiến hiệu suất và bản vá bảo mật.

6. Tóm lại & Đánh giá giá trị

CácMellanox (NVIDIA Mellanox) MQM9790-NS2Fcung cấp một nền tảng hiệu suất cao trong tương lai cho các cụm RDMA / HPC / AI. Bằng cách kết hợp tốc độ NDR 400 Gb / s, mật độ cổng 64 và điện toán thông minh trong mạng,nó loại bỏ các nút thắt truyền thống và cung cấp khả năng mở rộng tuyến tính lên đến lớp exascaleGiải pháp giảm tổng chi phí sở hữu thông qua năng lượng thấp hơn mỗi cổng (≈1.5 W), cáp đơn giản hóa và giảm chi phí CPU từ việc giảm tải SHARP.

Đối với các tổ chức đánh giáGiá MQM9790-NS2F, đầu tư được biện minh bởi những lợi ích có thể đo lường trong việc sử dụng GPU (thường vượt quá 90% trong sản xuất) và giảm đến 40% thời gian hoàn thành công việc so với vải RoCEv2.MQM9790-NS2FThông số kỹ thuật MQM9790-NS2Fcung cấp chi tiết toàn diện, và các đơn vị có sẵn (MQM9790-NS2F để bánHơn nữa, tính tương thích của bộ chuyển đổi với các bộ chuyển đổi NVIDIA hiện có đảm bảo một con đường di chuyển suôn sẻ cho người dùng đã đầu tư vào hệ sinh thái Mellanox.

Tóm lại, giải pháp kỹ thuật này dựa trênMQM9790-NS2F InfiniBand switchcung cấp một cấu trúc mạnh mẽ, hoạt động hiệu quả đáp ứng các yêu cầu liên kết độ trễ thấp đòi hỏi khắt khe nhất - một nền tảng cho thế hệ siêu máy tính AI tiếp theo.