Sách trắng kỹ thuật về Switch InfiniBand NVIDIA Mellanox MQM8790-HS2F

August 21, 2026

Sách trắng kỹ thuật về Switch InfiniBand NVIDIA Mellanox MQM8790-HS2F

Sách trắng kỹ thuật của NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch: Tối ưu hóa kết nối có độ trễ thấp cho các cụm RDMA/HPC/AI

Sách trắng kỹ thuật này dành cho các kiến ​​trúc sư mạng, kỹ sư tiền bán hàng và người quản lý vận hành. Nó tập trung vàoNVIDIA Mellanox MQM8790-HS2FBộ chuyển mạch InfiniBand HDR 200Gb/s, cung cấp thiết kế giải pháp toàn diện để tối ưu hóa kết nối có độ trễ thấp trong các cụm điện toán hiệu năng cao (HPC) và trí tuệ nhân tạo (AI) được tăng tốc RDMA. Tài liệu này bao gồm thiết kế kiến ​​trúc, các công nghệ chủ chốt, chiến lược triển khai và mở rộng quy mô, giám sát hoạt động và đánh giá giá trị—cung cấp kế hoạch chi tiết có thể tái tạo cho cơ sở hạ tầng điện toán sử dụng nhiều dữ liệu thế hệ tiếp theo.

1. Phân tích bối cảnh và yêu cầu của dự án

Khi các tham số mô hình AI đạt tới cường độ nghìn tỷ và mô phỏng HPC yêu cầu độ phân giải ngày càng tốt hơn, kết cấu mạng cơ bản đã phát triển từ thành phần hỗ trợ thành yếu tố quyết định hiệu suất chính. Ví dụ: các công việc đào tạo phân tán có thể dành 40–60% thời gian chạy của chúng cho các hoạt động liên lạc tập thể nếu kết nối thiếu các đặc tính về băng thông và độ trễ. Đối với các nhóm CNTT của doanh nghiệp, điều này trực tiếp chuyển thành thời gian tiếp thị kéo dài cho các sáng kiến ​​AI và các khoản đầu tư GPU không được sử dụng đúng mức.

Các yêu cầu chính được xác định thông qua sự tham gia rộng rãi của khách hàng bao gồm:

  • Độ trễ cực thấp và có thể dự đoán được:Chuyển mạch cắt ngang dưới 200ns cho lưu lượng MPI và RDMA, với độ giật tối thiểu đang bị tranh chấp.
  • Thông lượng không chặn:Hiệu suất tốc độ đường truyền được duy trì đồng thời trên tất cả các cổng, loại bỏ sự hình thành điểm nóng và suy giảm độ trễ đuôi.
  • Tính toán trong mạng:Tăng tốc phần cứng cho các hoạt động tập thể (giảm toàn bộ, phát sóng, rào cản) để giảm tải cho CPU chủ và giảm chuyển động dữ liệu.
  • Hỗ trợ cấu trúc liên kết có thể mở rộng:Khả năng xây dựng các cấu trúc liên kết cây mập, hình xuyến hoặc chuồn chuồn + trải dài hàng trăm đến hàng nghìn nút mà không cần quá nhiều lớp chuyển đổi.
  • Quản lý đơn giản:Giám sát kết cấu thống nhất, phát hiện cấu trúc liên kết tự động và phát hiện lỗi chủ động để giảm chi phí vận hành.

cácMQM8790-HS2Fđã được chọn làm khối xây dựng tối ưu cho kiến ​​trúc giải pháp này, với sơ bộBảng dữ liệu MQM8790-HS2Fxác nhận 40 cổng HDR 200Gb/s, độ trễ cắt dưới 130ns và hỗ trợ điện toán trong mạng SHARP v3.0—các khả năng ánh xạ trực tiếp đến các yêu cầu trên.

2. Thiết kế kiến ​​trúc mạng/hệ thống tổng thể

Kiến trúc được đề xuất sử dụng cấu trúc liên kết cây mỡ cột sống lá hai tầng cho các cụm lên tới 1.200 nút, với tùy chọn mở rộng lên ba tầng để triển khai lớn hơn. Cấu trúc liên kết này cân bằng hiệu suất, chi phí và khả năng quản lý, cung cấp băng thông chia đôi đầy đủ và độ trễ xác định trên toàn bộ kết cấu.

cấp Loại thiết bị Số cổng (Đã sử dụng) Vai trò kết nối
Lá cây MQM8790-HS2F 32 x 200Gb/s (16 đến nút, 16 đến gai) Tổng hợp tính toán lưu lượng nút
Xương sống MQM8790-HS2F 40 x 200Gb/s (tất cả chuyển sang lá) Kết nối chéo không chặn giữa các lá

Mỗi công tắc lá kết nối tối đa 16 nút điện toán thông qua bộ điều hợp kênh máy chủ NVIDIA ConnectX-6 hoặc ConnectX-7 HDR, sử dụngTương thích MQM8790-HS2Fhệ sinh thái quang học—bao gồm cả cáp quang chủ động (AOC) và DAC đồng thụ động, tùy thuộc vào khoảng cách liên kết. cácMQM8790-HS2F 200Gb/s HDR 40 cổng QSFP56thiết kế cung cấp mật độ dồi dào cho việc tổng hợp ở cấp độ giá đỡ trong khi vẫn duy trì hệ số dạng 1U để sử dụng không gian giá đỡ hiệu quả.

Đối với các cụm vượt quá 1.200 nút, nên sử dụng cấu trúc liên kết ba tầng với lớp siêu cột sống bổ sung. Trong cấu hình này,Giải pháp chuyển mạch InfiniBand MQM8790-HS2Fduy trì vai trò của mình trên tất cả các tầng, đơn giản hóa việc quản lý cấu hình và tiết kiệm—một loại công tắc duy nhất hỗ trợ toàn bộ kết cấu, từ cạnh đến lõi.

3. Vai trò và các tính năng chính của NVIDIA Mellanox MQM8790-HS2F

cácNVIDIA Mellanox MQM8790-HS2Fđóng vai trò là thành phần chuyển mạch nền tảng trong kiến ​​trúc này, cung cấp các khả năng khác biệt sau đây trực tiếp thúc đẩy tối ưu hóa kết nối có độ trễ thấp:

  • Tốc độ cổng HDR 200Gb/s:Nhân đôi băng thông của EDR thế hệ trước (100Gb/s) trong khi vẫn duy trì khả năng tương thích ngược với HDR100 (100Gb/s) cho môi trường tốc độ hỗn hợp, bảo vệ các khoản đầu tư trước đó.
  • Chuyển đổi cắt ngang với độ trễ dưới 130ns:Giảm thiểu thời gian sử dụng các gói trong bộ chuyển mạch, điều này rất quan trọng đối với các hoạt động RDMA nhạy cảm với độ trễ và các kiểu giao tiếp chung.
  • Điện toán trong mạng SHARP v3.0:Giảm tải các hoạt động giảm tải từ CPU chủ sang kết cấu chuyển mạch, giảm lưu lượng dữ liệu tới 30% và tăng tốc hiệu suất giảm toàn bộ cho hoạt động đào tạo AI lên tới 2 lần.
  • Định tuyến thích ứng và kiểm soát tắc nghẽn:Phân phối động lưu lượng truy cập trên nhiều đường dẫn để tránh các điểm nóng, với cờ tắc nghẽn và kiểm soát luồng dựa trên tín dụng để đảm bảo hoạt động không bị tổn thất—điều kiện tiên quyết cho hiệu suất RDMA.
  • Tích hợp đo từ xa và chẩn đoán:Cung cấp khả năng hiển thị chi tiết về tình trạng chiếm dụng bộ đệm trên mỗi cổng, tỷ lệ lỗi liên kết và mẫu lưu lượng truy cập, cho phép chủ động tối ưu hóa và cách ly lỗi nhanh chóng.

Theo chi tiếtThông số kỹ thuật MQM8790-HS2F, công tắc hỗ trợ cả hai biến thể luồng khí thuận và ngược, đáp ứng các thiết kế làm mát trung tâm dữ liệu đa dạng. Bộ nguồn dự phòng kép và mô-đun quạt có thể thay thế nóng giúp nâng cao hơn nữa độ tin cậy và khả năng bảo trì.

4. Khuyến nghị triển khai và mở rộng (với cấu trúc liên kết điển hình)

Để triển khai ban đầu một cách cân bằng và tiết kiệm chi phí, bạn nên áp dụng các phương pháp hay nhất sau đây:

  • Kết nối nút-lá:Sử dụng cáp HDR 200Gb/s (DAC đồng cho 3m, AOC cho 30m) vớiTương thích MQM8790-HS2FĐầu nối QSFP56. Đảm bảo bộ điều hợp kênh máy chủ được định cấu hình cho cùng tốc độ liên kết và cài đặt FEC như các cổng chuyển mạch.
  • Kết nối từ lá tới cột sống:Triển khai AOC 200Gb/s hoặc bộ thu phát cáp quang đa chế độ cho khoảng cách lên tới 100m. cácMQM8790-HS2Ftự động đàm phán các tham số liên kết, đơn giản hóa việc triển khai.
  • Lập kế hoạch đăng ký vượt mức:Đối với khối lượng công việc AI/HPC có mục đích chung, tỷ lệ đăng ký vượt mức 2:1 (hai nút điện toán trên mỗi đường lên 200Gb/s) mang lại điểm hấp dẫn về hiệu suất chi phí. Đối với khối lượng công việc cần nhiều dung lượng lưu trữ hoặc được tối ưu hóa độ trễ, hãy cân nhắc đăng ký vượt mức 1:1 (đầy đủ).
  • Đường dẫn mở rộng:Khi thêm các giá đỡ mới, bạn chỉ cần triển khai thêm các công tắc lá bổ sung và kết nối chúng với các công tắc cột sống hiện có. Để tăng công suất đáng kể (tăng gấp đôi số lượng nút), hãy nâng cấp lớp cột sống lên cơ số cao hơn hoặc thêm lớp siêu cột sống.

Khi đánh giá cácGiá MQM8790-HS2Fvà tổng chi phí sở hữu, hãy cân nhắc rằng kiến ​​trúc hợp nhất—sử dụng cùng một loại công tắc trên tất cả các tầng kết cấu—giảm yêu cầu tồn kho phụ tùng thay thế khoảng 70% so với phương pháp tiếp cận nhiều SKU. Việc đơn giản hóa này giúp tăng tốc khả năng phản hồi sự cố và giảm thiểu thời gian ngừng hoạt động khi xảy ra lỗi phần cứng.

5. Giám sát hoạt động, khắc phục sự cố và tối ưu hóa

Quản lý hiệu quả mộtCông tắc InfiniBand MQM8790-HS2Fmôi trường đòi hỏi một cách tiếp cận có hệ thống để theo dõi, chẩn đoán và điều chỉnh hiệu suất.

Giám sát các phương pháp hay nhất:

  • Triển khai Trình quản lý vải hợp nhất (UFM) của NVIDIA để có khả năng hiển thị kết cấu tập trung, bao gồm bản đồ cấu trúc liên kết, bản đồ nhiệt sử dụng trên mỗi liên kết và biểu đồ độ trễ thời gian thực.
  • Giám sát bộ đếm lỗi trên mỗi cổng—đặc biệt là lỗi CRC, lỗi ký hiệu và các sự kiện liên kết xuống—để sớm xác định chất lượng quang học hoặc cáp xuống cấp. Đặt bẫy SNMP cho các ngưỡng được xác định trước để cho phép bảo trì chủ động.
  • Theo dõi hiệu quả hoạt động chung của SHARP thông qua bộ đếm hiệu suất tích hợp của bộ chuyển mạch, xác định các cơ hội để tối ưu hóa các mẫu giao tiếp chung ở cấp ứng dụng.

Khắc phục sự cố thường gặp:

  • Liên kết lỗi CRC trên các cổng cụ thể:Kiểm tra chỗ ngồi cáp và độ sạch của các đầu nối quang. Nếu lỗi vẫn còn, hãy thay cáp hoặc bộ thu phát. cácBảng dữ liệu MQM8790-HS2Fcung cấp ngưỡng chẩn đoán chi tiết trên mỗi cổng.
  • Độ trễ tăng đột biến không mong đợi:Kiểm tra các điểm nóng tắc nghẽn bằng cách sử dụng phân tích lưu lượng truy cập của UFM. Định tuyến thích ứng có thể cần phải cấu hình lại cho các mẫu lưu lượng truy cập nhất định—thử nghiệm các thuật toán định tuyến khác nhau (tối thiểu và không tối thiểu).
  • Các vấn đề về phân vùng vải:Đảm bảo cấu hình khóa phân vùng (PKey) và trình quản lý mạng con IPoIB thích hợp. Trình quản lý mạng con tích hợp của switch cung cấp khả năng khám phá kết cấu tự động, nhưng có thể cần phải điều chỉnh thủ công đối với môi trường nhiều người thuê.

Mẹo tối ưu hóa hiệu suất:

  • Đối với khối lượng công việc đào tạo AI, hãy bật SHARP v3.0 và định cấu hình các thư viện giao tiếp chung (NCCL, OpenMPI) để sử dụng khả năng giảm tải của bộ chuyển mạch. Điều này có thể giảm độ trễ hoàn toàn xuống tới 2 lần đối với kích thước tin nhắn lớn.
  • Đối với các ứng dụng HPC nhạy cảm với độ trễ, hãy cân nhắc việc tắt tính năng định tuyến thích ứng để thực thi việc lựa chọn đường dẫn xác định, đánh đổi một số tính đa dạng của đường dẫn để lấy độ trễ có thể dự đoán được.
  • Định kỳ xem xét và cập nhật chương trình cơ sở của switch, vì NVIDIA thường xuyên phát hành các cải tiến hiệu suất và bản vá bảo mật. Tham khảoBảng dữ liệu MQM8790-HS2Fcho ma trận tương thích phiên bản.

6. Tóm tắt và đánh giá giá trị

cácNVIDIA Mellanox MQM8790-HS2Fđưa ra đề xuất giá trị hấp dẫn cho các tổ chức xây dựng hoặc nâng cấp cụm RDMA/HPC/AI. Bằng cách cung cấp tốc độ 200Gb/s trên mỗi cổng, độ trễ dưới 130ns và khả năng tăng tốc tính toán trong mạng trong khung 1U, 40 cổng, bộ chuyển mạch này giải quyết các yêu cầu kết nối nghiêm ngặt nhất của khối lượng công việc sử dụng nhiều dữ liệu hiện đại.

Trình điều khiển giá trị chính bao gồm:

  • Khả năng mở rộng hiệu suất:Kiến trúc cây mỡ không chặn được xây dựng xung quanhMQM8790-HS2F 200Gb/s HDR 40 cổng QSFP56các nút có quy mô từ 200 đến hơn 10.000 nút mà không có thay đổi cấu trúc liên kết cơ bản.
  • Hiệu quả hoạt động:Một loại công tắc duy nhất trên tất cả các cấp kết cấu giúp giảm tồn kho phụ tùng, đơn giản hóa việc đào tạo và tăng tốc độ khắc phục sự cố.
  • Bảo hộ đầu tư:Khả năng tương thích ngược với HDR100 và EDR cho phép nâng cấp theo từng giai đoạn, trong khi kiểu dáng và mật độ cổng của bộ chuyển mạch phù hợp với lộ trình 400G (NDR) trong tương lai.
  • Hệ sinh thái đã được chứng minh:Tích hợp sâu với bộ điều hợp ConnectX, DPU BlueField và nền tảng quản lý UFM của NVIDIA đảm bảo khả năng dự đoán hiệu suất toàn diện.

Đối với các tổ chức sẵn sàng triển khai,Cần bán MQM8790-HS2Fthông qua mạng lưới các nhà phân phối được ủy quyền toàn cầu của NVIDIA bao gồm các tùy chọn hỗ trợ toàn diện, bao gồm phụ tùng thay thế nâng cao và đăng ký cập nhật chương trình cơ sở. Chi tiếtThông số kỹ thuật MQM8790-HS2Fvà các thiết kế tham khảo có sẵn thông qua cổng tài liệu kỹ thuật của NVIDIA và tư vấn cấu trúc liên kết tùy chỉnh được cung cấp cho việc triển khai các lĩnh vực nâu hoặc lĩnh vực xanh quy mô lớn.