NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch hoạt động: Tối ưu hóa kết nối liên kết độ trễ thấp cho RDMA / HPC / AI Cluster

August 21, 2026

tin tức mới nhất của công ty về NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch hoạt động: Tối ưu hóa kết nối liên kết độ trễ thấp cho RDMA / HPC / AI Cluster

NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch Hoạt Động: Tối Ưu Hóa Kết Nối Độ Trễ Thấp Cho Các Cụm RDMA/HPC/AI

Trong lĩnh vực đào tạo mô hình AI quy mô lớn và tính toán hiệu năng cao (HPC), độ trễ mạng thường trở thành nút thắt cổ chai quan trọng, hạn chế khả năng mở rộng và hiệu quả của cụm. Một trung tâm siêu máy tính cấp quốc gia gần đây đã hoàn thành việc nâng cấp cơ sở hạ tầng lớn, chuyển đổi từ mạng InfiniBand EDR 100Gb/s sang giải pháp HDR 200Gb/s được xây dựng xung quanh bộ chuyển mạch InfiniBand NVIDIA Mellanox MQM8790-HS2F. Nghiên cứu tình huống này xem xét các thách thức họ phải đối mặt, chiến lược triển khai và những cải thiện hiệu suất có thể đo lường được đạt được thông qua kết nối thế hệ tiếp theo này.

Bối cảnh và Thách thức: Khi Độ trễ Trở thành Giới hạn Hiệu suất

Trung tâm siêu máy tính vận hành một cụm không đồng nhất bao gồm hơn 2.000 nút GPU, hỗ trợ nhiều loại khối lượng công việc đa dạng bao gồm mô phỏng thời tiết, nghiên cứu bộ gen và đào tạo mô hình ngôn ngữ lớn. Với mạng EDR 100Gb/s trước đây, đội ngũ vận hành nhận thấy rằng các hoạt động giao tiếp tập thể — như all-reduce và all-gather — đang chiếm một phần ngày càng tăng trong tổng thời gian chạy tác vụ khi số lượng nút tăng lên. Trong một số tác vụ đào tạo phân tán, chi phí hoạt động liên quan đến mạng chiếm gần 40% thời gian thực thi đầu cuối, làm giảm nghiêm trọng việc sử dụng GPU và kéo dài chu kỳ hội tụ mô hình.

Các thách thức bổ sung bao gồm:

  • Các điểm nóng tắc nghẽn: Các mẫu lưu lượng trong đào tạo AI thường có tính chất đột biến và khó đoán, dẫn đến tắc nghẽn đầu hàng đợi và các đỉnh độ trễ đuôi làm gián đoạn việc lập lịch tác vụ.
  • Tăng tốc trong mạng không đủ: Mạng cũ thiếu hỗ trợ cho các khả năng giảm tải tập thể nâng cao, buộc tất cả các hoạt động giảm thiểu phải đi qua CPU máy chủ và hệ thống phân cấp bộ nhớ.
  • Độ phức tạp quản lý: Việc khắc phục sự cố hiệu suất đòi hỏi phân tích thủ công nhiều công cụ giám sát, gây khó khăn cho việc xác định nguyên nhân gốc rễ trong các triển khai quy mô lớn.

Sau khi đánh giá nhiều tùy chọn kết nối, trung tâm đã chọn MQM8790-HS2F làm nền tảng cho mạng mới của mình. Theo datasheet của MQM8790-HS2F, bộ chuyển mạch này cung cấp 40 cổng thông lượng không chặn HDR 200Gb/s, độ trễ cắt ngang dưới 130ns và hỗ trợ giảm tải tập thể SHARP v3.0 — các khả năng trực tiếp giải quyết các điểm yếu cốt lõi của họ.

Giải pháp và Triển khai: Xây dựng Mạng Độ trễ Thấp cho AI/HPC

Việc triển khai áp dụng cấu trúc liên kết cây béo hai tầng, với 24 bộ chuyển mạch MQM8790-HS2F 200Gb/s HDR 40 cổng QSFP56 được triển khai làm nút lá và 8 đơn vị làm bộ chuyển mạch trục. Cấu hình này cung cấp tỷ lệ quá tải 2:1 trên toàn bộ cụm — đủ cho khối lượng công việc hiện tại của họ đồng thời cho phép không gian để mở rộng trong tương lai.

Lớp Triển khai Số lượng Bộ chuyển mạch Cổng Sử dụng Kết nối
Lá (mỗi rack) 24 32 cổng mỗi cái Máy chủ ToR + đường lên trục
Trục 8 36 cổng mỗi cái Lưới đầy đủ đến tất cả các bộ chuyển mạch lá

Mỗi bộ chuyển mạch lá kết nối với các nút tính toán thông qua bộ điều hợp kênh máy chủ NVIDIA ConnectX-6 HDR. Hệ sinh thái quang và cáp tương thích MQM8790-HS2F cho phép nhóm tái sử dụng cáp QSFP56 hiện có, đẩy nhanh quá trình triển khai và giảm chi phí mua sắm. Toàn bộ việc lắp đặt vật lý đã hoàn thành trong vòng hai tuần, với mặt phẳng điều khiển sử dụng Trình quản lý Vải Thống nhất (UFM) của NVIDIA để khám phá cấu trúc liên kết và cung cấp tự động.

Khả năng hỗ trợ định tuyến thích ứng và kiểm soát tắc nghẽn của bộ chuyển mạch đã chứng tỏ là yếu tố quan trọng để xử lý lưu lượng đột biến đặc trưng của khối lượng công việc AI. Bằng cách phân phối lại động các luồng trên các đường dẫn khả dụng, bộ chuyển mạch InfiniBand MQM8790-HS2F đã giảm thiểu sự hình thành các điểm nóng và duy trì hiệu suất nhất quán ngay cả trong các giai đoạn lập lịch tác vụ cao điểm.

Kết quả và Lợi ích: Cải thiện Có thể Đo lường về Thông lượng Tác vụ và Sử dụng GPU

Sau ba tháng hoạt động sản xuất, trung tâm siêu máy tính đã báo cáo những cải thiện hiệu suất đáng kể trên nhiều khía cạnh:

  • Giảm độ trễ: Độ trễ MPI ping-pong trung bình giảm từ 680 ns trên mạng EDR trước đây xuống dưới 130 ns với NVIDIA Mellanox MQM8790-HS2F, tương đương với mức cải thiện 5 lần về hiệu quả trao đổi tin nhắn.
  • Tăng tốc hoạt động tập thể: Độ trễ All-reduce cho các tác vụ 1024 nút giảm 62%, nhờ vào việc giảm tải SHARP v3.0 thực hiện các hoạt động giảm thiểu trực tiếp trong mạng bộ chuyển mạch.
  • Sử dụng GPU: Hiệu ứng kết hợp của độ trễ thấp hơn và băng thông cao hơn đã đẩy mức sử dụng GPU trung bình từ 72% lên 91%, tương đương với việc giảm 26% thời gian để đạt được giải pháp cho các lần chạy đào tạo mô hình ngôn ngữ lớn.
  • Hiệu quả lập lịch tác vụ: Giảm sự biến động độ trễ đuôi cho phép bộ lập lịch SLURM đóng gói nhiều tác vụ hơn trên cùng một tập hợp các nút mà không bị ảnh hưởng hiệu suất, tăng thông lượng tổng thể của cụm lên khoảng 18%.

Khi nhóm sau đó đã kiểm tra giá MQM8790-HS2F so với các bộ chuyển mạch thay thế từ các nhà cung cấp khác, họ nhận thấy tổng chi phí trên mỗi Gb/s được cung cấp rất cạnh tranh — đặc biệt khi tính đến chi phí quản lý giảm và khả năng của bộ chuyển mạch hỗ trợ cả tốc độ liên kết HDR và HDR100, bảo vệ các khoản đầu tư trong môi trường tốc độ hỗn hợp.

Từ góc độ vận hành, nền tảng UFM tích hợp cung cấp một giao diện duy nhất để giám sát sức khỏe mạng, các mẫu lưu lượng và lỗi ở cấp độ liên kết. Khả năng hiển thị này cho phép nhóm chủ động xác định các cáp bị suy giảm và thay thế chúng trong quá trình bảo trì theo lịch trình, tránh thời gian ngừng hoạt động đột xuất.

Tóm tắt và Triển vọng: Một Bản thiết kế cho Mạng Độ trễ Thấp Thế hệ Tiếp theo

Nghiên cứu tình huống này chứng minh rằng giải pháp bộ chuyển mạch InfiniBand MQM8790-HS2F không chỉ đơn thuần là nâng cấp tốc độ — nó là một thành phần mang tính chuyển đổi cho các tổ chức đang tìm cách mở khóa toàn bộ tiềm năng hiệu suất của cơ sở hạ tầng AI và HPC của họ. Bằng cách kết hợp mật độ cổng cao, độ trễ cực thấp và khả năng tính toán trong mạng, bộ chuyển mạch trực tiếp giải quyết các nút thắt giao tiếp đã hạn chế khả năng mở rộng của cụm trong lịch sử.

Nhìn về phía trước, trung tâm siêu máy tính có kế hoạch mở rộng mạng của mình lên 2.400 nút trong năm tài chính tiếp theo, tận dụng kiến trúc MQM8790-HS2F tương tự với các bộ chuyển mạch trục bổ sung. Nhóm cũng đang khám phá khả năng hỗ trợ của bộ chuyển mạch đối với các thuật toán giảm thiểu nâng cao của SHARP v3.0, hứa hẹn sẽ tăng tốc hơn nữa các khối lượng công việc mới nổi như mạng nơ-ron đồ thị và học tăng cường.

Đối với các nhà quản lý CNTT, kiến trúc sư mạng và kỹ sư đánh giá các tùy chọn kết nối cho các bản dựng cụm của riêng họ, NVIDIA Mellanox MQM8790-HS2F cung cấp một con đường đã được chứng minh, xác thực tại thực địa để đạt được độ trễ dưới micro giây, tối đa hóa việc sử dụng GPU và đơn giản hóa việc quản lý mạng. Thông số kỹ thuật MQM8790-HS2F chi tiết và các thiết kế tham chiếu có sẵn từ cổng tài liệu kỹ thuật của NVIDIA, và bộ chuyển mạch hiện đã có sẵn rộng rãi — tìm kiếm MQM8790-HS2F để bán để xác định đối tác khu vực.