NVIDIA Mellanox MCX631102AN-ADAT hoạt động: RDMA / RoCE Giao thông chậm và tối ưu hóa hiệu suất máy chủ

July 27, 2026

tin tức mới nhất của công ty về NVIDIA Mellanox MCX631102AN-ADAT hoạt động: RDMA / RoCE Giao thông chậm và tối ưu hóa hiệu suất máy chủ

NVIDIA Mellanox MCX631102AN-ADAT trong thực tế: Truyền tải độ trễ thấp RDMA/RoCE và Tối ưu hóa Thông lượng Máy chủ

Bối cảnh & Thách thức: Nút thắt Cổ chai Độ trễ và Thông lượng trong Lưu trữ Phân tán

Một nhà cung cấp dịch vụ đám mây quy mô trung bình vận hành một cụm lưu trữ Ceph phân tán trên 120 máy chủ x86 bắt đầu gặp phải các vấn đề hiệu suất ngày càng tăng. Cơ sở hạ tầng mạng 10GbE hiện có của họ, dựa vào TCP/IP cho giao tiếp giữa các nút, đang gặp khó khăn để theo kịp các nhóm lưu trữ dựa trên NVMe ngày càng mở rộng. Các triệu chứng chính bao gồm việc sử dụng CPU cao vượt quá 45% trên các nút lưu trữ do xử lý giao thức mạng, độ trễ đọc/ghi trung bình tăng vọt trên 3 mili giây trong giờ cao điểm và khoảng cách đáng kể giữa thông lượng đĩa lý thuyết và hiệu suất thực tế được cung cấp bởi mạng. Đội ngũ kỹ thuật nhận ra rằng việc đạt được độ trễ dưới mili giây và phát huy tối đa hiệu suất NVMe đòi hỏi một sự thay đổi cơ bản trong cách tiếp cận mạng — cụ thể là, áp dụng RDMA qua Ethernet Hợp nhất (RoCE).

Giải pháp & Triển khai: Giới thiệu Giải pháp Card Bộ điều hợp Ethernet MCX631102AN-ADAT

Sau khi đánh giá nhiều tùy chọn nhà cung cấp, đội ngũ đã chọnNVIDIA Mellanox MCX631102AN-ADAT làm yếu tố thúc đẩy cốt lõi cho việc nâng cấp mạng của họ. Card bộ điều hợpMCX631102AN-ADAT ConnectX-6 Lx dual-port 25GbE SFP28 đã được chọn vì hỗ trợ RoCEv2 gốc, kiểm soát tắc nghẽn dựa trên phần cứng và tích hợp liền mạch với cơ sở hạ tầng cáp SFP28 hiện có của họ.

Chiến lược triển khai được chia thành ba cụm:

  • Giai đoạn 1 (Thí điểm):16 nút lưu trữ được trang bịcard bộ điều hợp Ethernet MCX631102AN-ADAT, thay thế các NIC 10GbE cũ. Các bộ điều hợp được cấu hình ở chế độ dual-port active-active, với mỗi cổng được kết nối với một cặp switch NVIDIA Spectrum để dự phòng.
  • Giai đoạn 2 (Tối ưu hóa):RoCEv2 được bật với Priority Flow Control (PFC) và Explicit Congestion Notification (ECN) được tinh chỉnh để ngăn chặn mất gói mạng. Đội ngũ đã tận dụng các bộ tăng tốc phần cứng của bộ điều hợp cho các phép tính NVMe-oF và mã hóa xóa.
  • Giai đoạn 3 (Triển khai đầy đủ):Tất cả 120 nút đã được di chuyển sangNVIDIA Mellanox MCX631102AN-ADAT, với ngăn xếp mạng Ceph OSD (Object Storage Daemon) được cấu hình lại để sử dụng truyền tải RDMA.

Theodatasheet MCX631102AN-ADAT, giao diện PCIe 4.0 x8 của bộ điều hợp cung cấp băng thông dồi dào để xử lý thông lượng tổng hợp 50 Gb/s. Đội ngũ đã xác minh rằngthông số kỹ thuật MCX631102AN-ADAT— bao gồm độ trễ dưới 0,6 micro giây và chuyển hướng lưu lượng dựa trên phần cứng — hoàn toàn phù hợp với các yêu cầu hiệu suất nghiêm ngặt của họ. Bộ điều hợp cũng được chứng minh làtương thích MCX631102AN-ADATvới bản phân phối Linux hiện có của họ (RHEL 9.2) và trình điều khiển Mellanox OFED, giúp đơn giản hóa đáng kể quy trình triển khai.

Kết quả & Lợi ích: Tăng trưởng Đo lường được về Độ trễ và Thông lượng

Tác động của việc di chuyển ngay lập tức được thể hiện rõ trong các chỉ số sản xuất. Các cải tiến chính được quan sát sau khi triển khai bao gồm:

Chỉ số Trước nâng cấp (10GbE TCP/IP) Sau nâng cấp (MCX631102AN-ADAT với RoCE) Cải thiện
Độ trễ đọc trung bình 2,8 ms 0,4 ms Giảm 7 lần
Độ trễ ghi trung bình 3,2 ms 0,5 ms Giảm 6,4 lần
Sử dụng CPU nút (Ngăn xếp mạng) 42% 11% Giải phóng 31 pp
Thông lượng cụm tổng hợp 18 Gb/s 42 Gb/s Tăng 2,3 lần

Ngoài các con số, đội ngũ đã quan sát thấy những cải thiện đáng kể về hoạt động. CardMCX631102AN-ADATcho phép di chuyển trực tiếp liền mạch các máy ảo chạy các ứng dụng nhạy cảm với độ trễ, vì độ rung mạng giảm xuống mức không đáng kể. Bộ tăng tốc NVMe-oF dựa trên phần cứng đã giảm độ trễ truy cập lưu trữ thêm 30%, cho phép cụm xử lý các tải công việc đọc/ghi hỗn hợp với thời gian phản hồi nhất quán dưới mili giây. Đối với các tổ chức tính toán lợi tức đầu tư,giá MCX631102AN-ADATđã được chứng minh là hợp lý bởi mức tăng thông lượng 2,3 lần và khả năng trì hoãn việc mua thêm máy chủ ít nhất 18 tháng. Nhà cung cấp cũng lưu ý rằng các tùy chọnMCX631102AN-ADAT để bánthông qua các đối tác kênh cung cấp chiết khấu số lượng linh hoạt cho các triển khai quy mô lớn.

Hơn nữa, khả năng đo từ xa tích hợp và quản lý ngoài băng của bộ điều hợp — được chi tiết trongdatasheet MCX631102AN-ADAT— đã cung cấp khả năng hiển thị sâu sắc về tình trạng mạng, cho phép quản lý tắc nghẽn chủ động và phân tích nguyên nhân gốc rễ nhanh hơn trong quá trình giải quyết sự cố.

Tóm tắt & Triển vọng: Nền tảng Chiến lược cho Tải công việc Tương lai

Việc triển khai thực tế này cho thấy rằngNVIDIA Mellanox MCX631102AN-ADATvượt xa một bản nâng cấp băng thông đơn giản. Là mộtgiải pháp card bộ điều hợp Ethernet MCX631102AN-ADATđược chế tạo đặc biệt cho môi trường hỗ trợ RoCE, nó loại bỏ hiệu quả mạng như một nút thắt cổ chai hiệu suất, mở khóa toàn bộ tiềm năng của lưu trữ NVMe hiện đại và kiến trúc CPU. Sự kết hợp giữa thông lượng dual-port 25GbE, các bộ tăng tốc RDMA toàn diện và khả năng tương thích hệ sinh thái rộng lớn định vị bộ điều hợp này như một khoản đầu tư chiến lược cho bất kỳ tổ chức nào có kế hoạch mở rộng các đường ống AI/ML, cơ sở dữ liệu phân tán hoặc cơ sở hạ tầng siêu hội tụ.

Nhìn về phía trước, đội ngũ đang khám phá các trường hợp sử dụng mở rộng, bao gồm tích hợp NVIDIA DOCA cho các đường dẫn dữ liệu có thể lập trình và cung cấp không cần giám sát. Với khả năng đã được chứng minh trong việc giảm độ trễ, tăng thông lượng và giải phóng tài nguyên CPU, cardMCX631102AN-ADATthiết lập một tiêu chuẩn mới cho các bộ điều hợp máy chủ 25GbE trong môi trường doanh nghiệp và đám mây.