NVIDIA Mellanox MCX653106A-HDAT hoạt động: RDMA / RoCE Giao thông chậm và tối ưu hóa hiệu suất máy chủ

July 30, 2026

tin tức mới nhất của công ty về NVIDIA Mellanox MCX653106A-HDAT hoạt động: RDMA / RoCE Giao thông chậm và tối ưu hóa hiệu suất máy chủ
NVIDIA Mellanox MCX653106A-HDAT hoạt động: RDMA / RoCE Giao thông chậm và tối ưu hóa hiệu suất máy chủ
Bối cảnh & Thách thức: Khó khăn mạng của nhà cung cấp đám mây siêu quy mô

A major hyperscale cloud provider operating a 256-node cluster for distributed AI training and real-time analytics began experiencing severe network performance degradation as their infrastructure scaled. Các hiện tại 25GbE TCP / IP dựa trên vải trưng bày All-Reduce độ trễ vượt quá 6 mili giây trên 128 nút,trong khi việc sử dụng CPU để xử lý mạng tiêu thụ hơn 40% dung lượng tính toán của mỗi máy chủSự tắc nghẽn này hạn chế việc sử dụng GPU chỉ 55%, kéo dài đáng kể chu kỳ đào tạo và giảm khả năng tạo doanh thu.Nhóm cần một giải pháp có thể cung cấp cả độ trễ ở quy mô microsecond và băng thông lớn trong khi cung cấp khả năng lập trình cần thiết cho tối ưu hóa lưu lượng truy cập cụ thể.

Giải pháp và triển khai: Chuyển đổi vải với MCX653106A-HDAT

Sau một đánh giá kỹ thuật sâu rộng, nhà cung cấp đã chọnNVIDIA Mellanox MCX653106A-HDATnhư là nền tảng của sự chuyển đổi mạng của họ.MCX653106A-HDAT ConnectX adapter thẻ mạng PCIe, được cấu hình với kết nối 100GbE cổng kép để cung cấp 200 Gb / s băng thông tổng thể cho mỗi nút.

  • Giai đoạn 1 ¢ thí điểm (8 nút):Nhóm đã lắp đặtMCX653106A-HDAT Ethernet adapter cardtrên một tập hợp con của máy chủ GPU, cấu hình RoCEv2 với PFC và ECN để thiết lập một mô Ethernet không mất mát.
  • Giai đoạn 2: Xác thực và điều chỉnh:Sử dụng dữ liệu đo từ xa được ghi lại trongBảng dữ liệu MCX653106A-HDAT, nhóm đã xác nhận cấu hình, điều chỉnh các tham số DCB và tối ưu hóa cài đặt truyền thông tập thể NCCL.Các tính năng lập trình tiên tiến của bộ điều chỉnh cho phép điều khiển giao thông tùy chỉnh cho các mô hình giảm hoàn toàn cụ thể của khối lượng công việc.
  • Giai đoạn 3 ️ Quay sản xuất hoàn chỉnh (256 nút):Sau khi xác nhận thành công, toàn bộ cụm đã được di chuyển sang bộ chuyển đổi mới.MCX653106A-HDAT tương thíchBản chất của giải pháp đảm bảo tích hợp liền mạch với các máy chủ và bản phân phối Linux hiện có.
  • Giai đoạn 4: Tối ưu hóa liên tục:Nhóm nghiên cứu đã tận dụng tính toán từ xa trực tuyến và đường dẫn dữ liệu có thể lập trình của bộ điều chỉnh để thực hiện các chính sách định tuyến theo trọng lượng công việc, tối ưu hóa hiệu suất cho các công việc đào tạo AI.

Nhóm đã lưu ý rằngGiải pháp thẻ adapter MCX653106A-HDAT Ethernetcung cấp một con đường di chuyển đơn giản, vì các cổng QSFP56 hỗ trợ cả quang học 100GbE và 25GbE, cho phép chuyển đổi thanh lịch mà không làm gián đoạn kết nối hiện có.

Kết quả & Lợi ích: Biến đổi có thể đo lường trong hiệu suất và hiệu quả
Phương pháp đo Đăng cấp trước (25GbE TCP/IP) Sau khi nâng cấp (MCX653106A-HDAT với RoCE) Cải thiện
All-Reduce Latency (256 nút) 6.8 ms 0.22 ms 30.9* giảm
Sử dụng CPU mạng (mỗi nút) 43% 5% 38 pp thu hồi
Sử dụng GPU (giai đoạn đào tạo) 55% 93% +38% tăng
Công suất đào tạo cụm 2.1x đường cơ bản 6.4x đường cơ bản 3.0* tăng

Ngoài những lợi ích định lượng này, nhà cung cấp đã quan sát thấy lợi ích hoạt động đáng kể.tăng tốc đáng kể thời gian ra thị trường cho các dịch vụ AI mớiĐường dẫn dữ liệu có thể lập trình của bộ chuyển đổi cho phép định hình giao thông tùy chỉnh cho các luồng ưu tiên, đảm bảo rằng giao thông liên lạc tập thể quan trọng không bao giờ gặp phải tranh chấp.Đối với các tổ chức đánh giá lợi nhuận đầu tư,Giá MCX653106A-HDATđã được biện minh đầy đủ bởi sự gia tăng thông lượng 3 * và khả năng trì hoãn việc mua lại máy chủ bổ sung hơn 18 tháng.MCX653106A-HDAT để báncác gói với các công tắc NVIDIA Spectrum-4 cung cấp nền kinh tế thuận lợi nhất cho việc triển khai quy mô lớn.

Nhà cung cấp cũng tận dụng khả năng đo từ xa toàn diện được chi tiết trongMCX653106A-HDAT thông số kỹ thuậtxây dựng các mô hình hiệu suất dự đoán và các chiến lược giảm thiểu tắc nghẽn tự động, tiếp tục nâng cao hiệu quả hoạt động.

Tóm lại & triển vọng: Một nền tảng cho cơ sở hạ tầng AI siêu quy mô

Việc triển khai quy mô sản xuất này cho thấy rằngNVIDIA Mellanox MCX653106A-HDATlà một thành phần biến đổi cho cơ sở hạ tầng AI và đám mây hiện đại. Sự kết hợp của băng thông tổng cộng 200 Gb / s, độ trễ liên lạc tập thể dưới 0,3 millisecond,và tải phần cứng toàn diện cho phép mở rộng gần như tuyến tính cho khối lượng công việc tăng tốc GPUNhư một kết thúc-to-endGiải pháp thẻ adapter MCX653106A-HDAT Ethernet, nó loại bỏ nút thắt mạng mà trong lịch sử đã hạn chế hiệu quả đào tạo phân tán và cung cấp dịch vụ đám mây.

Nhìn về phía trước,Nhà cung cấp đám mây đang khám phá sự tích hợp mở rộng với NVIDIA DOCA để thực hiện khả năng lập trình đường dẫn dữ liệu bổ sung cho tối ưu hóa khối lượng công việc cụ thể trên nhiều môi trường thuêHọ cũng đang tận dụng tính toán từ xa trực tuyến của bộ điều chỉnhBảng dữ liệu MCX653106A-HDAT- phát triển các hệ thống quản lý hiệu suất tự động thế hệ tiếp theo.NVIDIA Mellanox MCX653106A-HDATđã trở thành nền tảng của lộ trình cơ sở hạ tầng AI của họ, cung cấp một nền tảng mạnh mẽ, có thể mở rộng cho thế hệ tiếp theo của đào tạo mô hình nền tảng và các dịch vụ phân tích thời gian thực.