NVIDIA Mellanox MCX623106AN-CDAT Server Adapter trong hành động.

July 22, 2026

tin tức mới nhất của công ty về NVIDIA Mellanox MCX623106AN-CDAT Server Adapter trong hành động.

NVIDIA Mellanox MCX623106AN-CDAT Bộ điều hợp máy chủ hoạt động | Vận chuyển độ trễ thấp RDMA/RoCE & Tăng thông lượng máy chủ

Bối cảnh & Thách thức: Khi 200GbE gặp phải Tường chắn mở rộng AI

Một tổ chức nghiên cứu AI đang phát triển nhanh chóng — hãy gọi họ là "DeepCore Labs" — đang đối mặt với một nút thắt cổ chai mở rộng nghiêm trọng. Cụm đào tạo mô hình ngôn ngữ lớn hàng đầu của họ, bao gồm 512 GPU NVIDIA H100 được phân phối trên 128 nút, đang gặp phải suy giảm hiệu suất nghiêm trọng khi họ mở rộng vượt quá 64 nút. Vấn đề không phải là tính toán hay bộ nhớ, mà là mạng lưới. Đồng bộ hóa gradient all-reduce mất hơn 15 giây mỗi lần lặp, và việc sử dụng GPU đã giảm xuống chỉ còn 62% do tắc nghẽn mạng. Cơ sở hạ tầng 100GbE hiện có của họ, dựa vào TCP/IP dựa trên phần mềm, đơn giản là không thể xử lý các mẫu giao tiếp bùng nổ, nhạy cảm với độ trễ của đào tạo phân tán. Nhóm cần một giải pháp có thể cung cấp thông lượng 200GbE tốc độ đường truyền với độ trễ xác định ở mức micro giây.

Đánh giá của họ đã dẫn họ đến NVIDIA Mellanox MCX623106AN-CDAT — một bộ điều hợp máy chủ 200GbE được thiết kế cho các khối lượng công việc AI và HPC đòi hỏi khắt khe nhất. Nhóm nghiên cứu nhận ra rằng MCX623106AN-CDAT ConnectX adapter PCIe network card cung cấp các tính năng offload nâng cao và khả năng GPUDirect cần thiết để loại bỏ nút thắt cổ chai mạng và tối đa hóa việc sử dụng GPU.

Giải pháp: Triển khai Bộ điều hợp Ethernet MCX623106AN-CDAT

DeepCore Labs đã triển khai MCX623106AN-CDAT Ethernet adapter card trên tất cả 128 nút đào tạo, với mỗi máy chủ được trang bị một bộ điều hợp QSFP112 cổng kép được kết nối với mạng leaf-spine được xây dựng trên các switch NVIDIA Spectrum-4. Việc triển khai tận dụng hỗ trợ RoCE v2 gốc của bộ điều hợp để cho phép truyền Ethernet không mất mát, loại bỏ nhu cầu về mạng InfiniBand riêng biệt. Điểm mấu chốt của giải pháp là khả năng GPUDirect RDMA của bộ điều hợp, cho phép truyền dữ liệu trực tiếp giữa các GPU trên mạng mà không cần sự can thiệp của CPU — một tính năng quan trọng để giảm chi phí đồng bộ hóa.

Nhóm đã cấu hình PFC (Kiểm soát luồng ưu tiên) và ECN (Thông báo tắc nghẽn rõ ràng) ở cấp độ switch, dành ưu tiên 3 cho lưu lượng giao tiếp tập thể và ưu tiên 4 cho I/O lưu trữ. Họ cũng triển khai công nghệ định tuyến thích ứng của NVIDIA để phân phối lưu lượng động trên nhiều đường dẫn, giảm thiểu các điểm nóng. Trong vòng bốn tuần, toàn bộ mạng lưới đào tạo đã hoạt động trên RDMA, với tất cả 512 GPU giao tiếp liền mạch qua RoCE. Hệ sinh thái MCX623106AN-CDAT compatible đã chứng tỏ sự mạnh mẽ — các thẻ đã tích hợp hoàn hảo với các máy chủ dựa trên H100 và NCCL (Thư viện Giao tiếp Tập thể NVIDIA) của NVIDIA mà không cần bất kỳ sửa đổi nào.

Nhóm đã tham khảo MCX623106AN-CDAT datasheet để tinh chỉnh phân bổ bộ đệm và các tham số kiểm soát tắc nghẽn, đạt được hiệu suất tối ưu cho môi trường khối lượng công việc hỗn hợp của họ — bao gồm cả đào tạo đồng bộ (chủ yếu là all-reduce) và sao lưu không đồng bộ.

Kết quả đo lường được: Hiệu quả mở rộng, Thông lượng và Sử dụng GPU

Sự gia tăng hiệu suất là mang tính chuyển đổi. Với RDMA qua RoCE được kích hoạt thông qua NVIDIA Mellanox MCX623106AN-CDAT, độ trễ đồng bộ hóa all-reduce đã giảm từ mức trung bình 15,2 giây xuống chỉ còn 1,8 giây mỗi lần lặp — cải thiện 8,4 lần. Điều này trực tiếp chuyển thành quá trình hội tụ mô hình nhanh hơn: tổng thời gian đào tạo cho mô hình 70 tỷ tham số của họ đã giảm từ 42 ngày xuống còn 19 ngày, đẩy nhanh chu kỳ nghiên cứu của họ hơn 50%.

Việc sử dụng GPU, vốn chỉ đạt 62% do tắc nghẽn mạng, đã tăng lên 94% sau khi nâng cấp — cải thiện 52% về năng lực tính toán hiệu quả. Cơ chế offload dữ liệu ngoài thứ tự nâng cao và điều chỉnh gói tin của bộ điều hợp đã loại bỏ các đợt bùng nổ nhỏ gây ra các đỉnh độ trễ đuôi, đảm bảo hiệu suất nhất quán trên tất cả các nút.

Ngoài hiệu suất đào tạo, việc tăng thông lượng máy chủ cũng rất hấp dẫn. Cơ chế offload phần cứng — bao gồm offload checksum, LSO/LRO và tăng tốc RoCE — đã giảm mức sử dụng CPU cho xử lý mạng từ 38% xuống dưới 4% trên tất cả các nút. Điều này giải phóng dung lượng CPU đáng kể cho tiền xử lý dữ liệu, nén bản sao lưu và các tác vụ phụ trợ khác vốn trước đây bị hạn chế.

Chỉ số Trước (NIC 100GbE cũ) Sau (MCX623106AN-CDAT) Cải thiện
Độ trễ All-Reduce (mỗi lần lặp) 15,2 giây 1,8 giây Nhanh hơn 8,4 lần
Sử dụng GPU 62% 94% Cao hơn 52%
Thời gian đào tạo mô hình (70 tỷ tham số) 42 ngày 19 ngày Nhanh hơn 55%
Chi phí xử lý mạng CPU 38% < 4% Thấp hơn 89%
Độ trễ đọc NVMe-oF (lưu trữ) 185 µs 12 µs Nhanh hơn 15 lần

Lợi ích vận hành: TCO và Hiệu quả cơ sở hạ tầng

Mặc dù hiệu suất tăng mạnh, lợi ích vận hành và tài chính cũng đáng chú ý không kém. Giải pháp MCX623106AN-CDAT Ethernet adapter card solution đã giảm tổng chi phí sở hữu bằng cách loại bỏ nhu cầu về mạng InfiniBand riêng biệt — tiết kiệm hơn 500 nghìn đô la chi phí cơ sở hạ tầng switch. Thiết kế tiết kiệm năng lượng của bộ điều hợp (dưới 20W mỗi thẻ) đã góp phần tiết kiệm năng lượng đáng kể trên cụm 128 nút, giảm chi phí làm mát hàng năm ước tính 18%.

Đối với các nhà quản lý CNTT đánh giá MCX623106AN-CDAT price so với các giải pháp thay thế, giám đốc cơ sở hạ tầng của DeepCore lưu ý rằng thời gian hoàn vốn dưới sáu tháng — chủ yếu được thúc đẩy bởi thời gian đào tạo giảm, trực tiếp đẩy nhanh quy trình phát triển sản phẩm của họ. Nhóm cũng đánh giá cao khả năng chống lỗi thời của bộ điều hợp: cùng một MCX623106AN-CDAT for sale ngày nay hỗ trợ 200GbE nhưng cũng tương thích với các quang 100GbE và 50GbE, cung cấp sự linh hoạt cho môi trường tốc độ hỗn hợp và nâng cấp dần dần.

Theo MCX623106AN-CDAT specifications, bộ điều hợp bao gồm các tính năng đo từ xa toàn diện, bao gồm đo từ xa mạng trong băng (INT) và theo dõi độ trễ trên mỗi luồng. DeepCore đã tích hợp các chỉ số này vào ngăn xếp Prometheus/Grafana của họ, cho phép phát hiện sớm tình trạng tắc nghẽn nhỏ trước khi nó ảnh hưởng đến hiệu suất đào tạo. Nhóm cũng tận dụng các thuật toán kiểm soát tắc nghẽn của bộ điều hợp để điều chỉnh động các ngưỡng ECN, duy trì hành vi không mất mát ngay cả trong các hoạt động sao lưu tạo ra tải mạng bổ sung.

Tóm tắt & Triển vọng: Bản thiết kế cho Mạng lưới quy mô AI

Hành trình của DeepCore Labs với NVIDIA Mellanox MCX623106AN-CDAT thể hiện một bản thiết kế rõ ràng cho các tổ chức xây dựng hoặc mở rộng cơ sở hạ tầng AI. Bằng cách kết hợp thông lượng 200GbE cổng kép, giao diện máy chủ PCIe 5.0 và RDMA hỗ trợ GPUDirect, MCX623106AN-CDAT Ethernet adapter card biến mạng lưới từ một nút thắt cổ chai mở rộng thành một bộ nhân hiệu suất. Kết quả — all-reduce nhanh hơn 8,4 lần, sử dụng GPU 94% và chu kỳ đào tạo nhanh hơn 55% — cho thấy khả năng của bộ điều hợp trong việc mang lại kết quả kinh doanh hữu hình trong các môi trường tính toán đòi hỏi khắt khe nhất.

Nhìn về phía trước, khi kích thước mô hình tiếp tục tăng gấp đôi sau mỗi vài tháng và các cụm đào tạo phân tán mở rộng lên hàng nghìn GPU, MCX623106AN-CDAT ConnectX adapter PCIe network card cung cấp một nền tảng vững chắc cho các mạng lưới không mất mát, độ trễ cực thấp. Đối với các kiến trúc sư và lãnh đạo CNTT đang lên kế hoạch đầu tư cơ sở hạ tầng AI tiếp theo của họ, bộ điều hợp này đại diện không chỉ là một thành phần, mà là một công cụ hỗ trợ chiến lược để tạo sự khác biệt cạnh tranh. Các tham số tinh chỉnh chi tiết, tập lệnh triển khai và báo cáo điểm chuẩn hiệu suất có sẵn trong MCX623106AN-CDAT datasheet chính thức — một tài liệu tham khảo thiết yếu cho bất kỳ triển khai AI quy mô lớn nào.