NVIDIA Mellanox 920-9B110-00FH-0D0 trong thực tế: Tối ưu hóa các vải RDMA độ trễ thấp cho các cụm HPC và AI

August 25, 2026

tin tức mới nhất của công ty về NVIDIA Mellanox 920-9B110-00FH-0D0 trong thực tế: Tối ưu hóa các vải RDMA độ trễ thấp cho các cụm HPC và AI

NVIDIA Mellanox 920-9B110-00FH-0D0 trong thực tế: Tối ưu hóa mạng RDMA độ trễ thấp cho các cụm HPC và AI

Bối cảnh & Thách thức: Khi hiệu suất HDR gặp thực tế ngân sách

Một phòng thí nghiệm nghiên cứu AI quy mô trung bình gần đây đã đối mặt với một thách thức quen thuộc: mạng InfiniBand EDR 100Gb/s hiện tại của họ đã trở thành một nút thắt cổ chai cho cụm GPU đang phát triển của họ, vốn đã tăng từ 128 lên 512 nút NVIDIA A100. Thời gian huấn luyện cho các mô hình transformer quy mô lớn đã tăng hơn 40% do tắc nghẽn mạng trong các hoạt động all-reduce, và nhóm cần một bản nâng cấp có thể mang lại những cải thiện hiệu suất đáng kể mà không cần chi phí vốn cần thiết cho việc triển khai NDR 400Gb/s đầy đủ.

Phòng thí nghiệm đã đánh giá nhiều tùy chọn và xác định 200Gb/s HDR là sự cân bằng lý tưởng giữa hiệu suất và chi phí. Tuy nhiên, họ cần một switch có thể cung cấp mật độ cổng cao, kiểm soát tắc nghẽn nâng cao và tích hợp liền mạch với các cáp và bộ thu phát tương thích HDR hiện có của họ. Đây chính xác là nơi NVIDIA Mellanox 920-9B110-00FH-0D0 xuất hiện — một switch được chế tạo riêng cho các môi trường mà HDR cung cấp băng thông dồi dào mà không cần cung cấp quá mức.

Giải pháp & Triển khai: Mạng HDR được tối ưu hóa chi phí

Phòng thí nghiệm đã triển khai 920-9B110-00FH-0D0 InfiniBand switch OPN (Mã đặt hàng) làm nền tảng cho kiến trúc leaf-spine mới của họ. Mỗi giá đỡ máy tính nhận một switch dựa trên MQM8790-HS2F — nền tảng silicon bên dưới 920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDR—, cung cấp 40 cổng kết nối 200Gb/s tới các máy chủ GPU thông qua cáp nối trực tiếp OSFP-to-OSFP. Ở lớp spine, bốn switch 920-9B110-00FH-0D0 bổ sung đã kết nối tất cả các switch leaf, tạo ra một mạng fat-tree không chặn với băng thông phân chia đầy đủ.

Điều làm cho việc triển khai này đặc biệt hiệu quả là công nghệ SHARPv2 (Scalable Hierarchical Aggregation and Reduction Protocol) tích hợp của switch, vốn đã giảm tải các hoạt động giao tiếp tập thể trực tiếp lên mạng lưới switch. Trong thực tế, điều này có nghĩa là các hoạt động all-reduce, vốn trước đây tiêu tốn đáng kể chu kỳ CPU máy chủ và băng thông mạng, giờ đây đã được hoàn thành trong một lần truyền qua mạng — giảm đáng kể thời gian hoàn thành tác vụ.

Theo datasheet 920-9B110-00FH-0D0, switch cung cấp độ trễ cut-through dưới 200ns, phù hợp chặt chẽ với các yêu cầu hiệu suất của phòng thí nghiệm. Nhóm kỹ thuật cũng xác nhận rằng hệ sinh thái tương thích 920-9B110-00FH-0D0 bao gồm tất cả các loại cáp và quang học mà họ đã tiêu chuẩn hóa, loại bỏ nhu cầu về việc đi lại cáp tốn kém.

Kết quả & Lợi ích đo lường được: Từ nút thắt cổ chai đến yếu tố thúc đẩy

Sau khi triển khai, phòng thí nghiệm đã đo lường được những cải thiện trên nhiều khía cạnh quan trọng:

  • Giảm thời gian hoàn thành tác vụ: Các vòng lặp huấn luyện cho mô hình có 13 tỷ tham số đã giảm 35%, với độ trễ all-reduce giảm từ 12μs xuống dưới 5μs cho các kích thước tập thể điển hình.
  • Sử dụng mạng: Mức sử dụng mạng trung bình đã tăng từ 58% lên 83% mà không gây ra tắc nghẽn, nhờ vào các cơ chế định tuyến thích ứng và kiểm soát tắc nghẽn của switch.
  • Hiệu quả năng lượng và làm mát: So với mạng EDR trước đây, cơ sở hạ tầng HDR mới đã giảm 30% mức tiêu thụ điện trên mỗi cổng, cho phép phòng thí nghiệm bổ sung thêm các nút tính toán mà không vượt quá ngân sách năng lượng của trung tâm dữ liệu.

Từ góc độ tổng chi phí sở hữu, giá 920-9B110-00FH-0D0 trên mỗi cổng thấp hơn đáng kể so với các giải pháp thay thế NDR, cho phép phòng thí nghiệm nâng cấp toàn bộ mạng của họ trong ngân sách hiện có. thông số kỹ thuật 920-9B110-00FH-0D0 cũng nhấn mạnh nguồn cung cấp điện dự phòng kép và các mô-đun quạt có thể thay thế nóng của switch, góp phần vào mục tiêu đạt 99,999% thời gian hoạt động cho các tác vụ huấn luyện sản xuất của phòng thí nghiệm.

Các kỹ sư mạng lưu ý rằng giải pháp OPN switch InfiniBand 920-9B110-00FH-0D0 đã tích hợp liền mạch với NVIDIA Unified Fabric Manager (UFM), cung cấp khả năng hiển thị tập trung về tình trạng mạng và cảnh báo tự động. Điều này đã giảm đáng kể thời gian dành cho việc khắc phục sự cố và bảo trì chủ động, giúp nhóm tập trung vào việc tối ưu hóa các quy trình huấn luyện của họ thay vì quản lý mạng.

Tóm tắt & Triển vọng: Nền tảng HDR có kích thước phù hợp

NVIDIA Mellanox 920-9B110-00FH-0D0 đã chứng tỏ là lựa chọn đúng đắn cho phòng thí nghiệm nghiên cứu này, mang lại hiệu suất 200Gb/s HDR với cấu trúc chi phí hợp lý về mặt kinh doanh. Bằng cách tận dụng mật độ 40 cổng của switch, khả năng tính toán trong mạng và các tính năng quản lý mạnh mẽ, phòng thí nghiệm đã biến mạng của họ từ một nút thắt cổ chai hiệu suất thành một nền tảng có thể mở rộng cho sự phát triển trong tương lai.

Nhìn về phía trước, phòng thí nghiệm có kế hoạch mở rộng cụm của họ lên 1.024 nút trong 18 tháng tới. Với sự hỗ trợ của 920-9B110-00FH-0D0 cho các cấu trúc lớn hơn thông qua nhiều tầng spine, họ tin tưởng rằng mạng của họ có thể phát triển cùng với năng lực tính toán của họ. Đối với các tổ chức đang đánh giá các tùy chọn cơ sở hạ tầng HDR của họ, 920-9B110-00FH-0D0 để bán thông qua các đối tác kênh của NVIDIA cung cấp một giải pháp hấp dẫn, đã được xác thực sản xuất, cân bằng hiệu suất, mật độ và chi phí.