NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Sách trắng kỹ thuật

July 24, 2026

NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Sách trắng kỹ thuật

Giấy trắng kỹ thuật Bộ điều hợp máy chủ NVIDIA Mellanox MCX623106AN-CDAT | Tối ưu hóa truyền tải độ trễ thấp RDMA/RoCE & Thông lượng máy chủ

1. Bối cảnh dự án & Phân tích yêu cầu

Các trung tâm dữ liệu hiện đại đang trải qua một sự thay đổi mô hình do sự tăng trưởng bùng nổ của trí tuệ nhân tạo, học máy quy mô lớn và phân tích thời gian thực. Các khối lượng công việc này đòi hỏi hiệu suất mạng chưa từng có — không chỉ băng thông thô, mà còn độ trễ xác định dưới 5μs, di chuyển dữ liệu hiệu quả CPU và khả năng mở rộng liền mạch lên hàng nghìn nút. Các bộ điều hợp Ethernet truyền thống, dựa vào ngăn xếp TCP/IP dựa trên phần mềm, đã trở thành một điểm nghẽn quan trọng, tiêu thụ tới 40% lõi CPU ở tốc độ 200GbE và gây ra các biến đổi độ trễ không thể đoán trước làm suy giảm hiệu suất ứng dụng. Đối với các tổ chức xây dựng các cụm AI quy mô lớn (500+ GPU) hoặc cơ sở hạ tầng đám mây siêu quy mô, sự kém hiệu quả này trực tiếp chuyển thành thời gian đào tạo kéo dài, chi phí cơ sở hạ tầng cao hơn và thời gian đưa ra thị trường chậm hơn.

Giấy trắng này trình bày một giải pháp kỹ thuật toàn diện tập trung vào bộ điều hợp máy chủ NVIDIA Mellanox MCX623106AN-CDAT. Được thiết kế cho các doanh nghiệp muốn tối đa hóa khoản đầu tư 200GbE của họ, Card mạng Ethernet MCX623106AN-CDAT cung cấp RDMA qua Ethernet hợp nhất (RoCE) được tăng tốc phần cứng, cho phép truyền tải không mất mát, độ trễ cực thấp, biến I/O mạng từ điểm nghẽn mở rộng thành lợi thế cạnh tranh. Giải pháp được kiến trúc đặc biệt để đáp ứng ba mục tiêu cốt lõi: (1) đạt được độ trễ ứng dụng đầu cuối dưới 5μs cho giao tiếp tập thể AI, (2) giảm chi phí xử lý mạng CPU xuống dưới 5% và (3) cung cấp nền tảng có thể mở rộng, sẵn sàng cho tương lai cho 200GbE trở lên.

2. Thiết kế kiến trúc mạng & hệ thống tổng thể

Kiến trúc được đề xuất áp dụng cấu trúc liên kết lá-xương sống hiệu suất cao với 200GbE làm lớp truy cập máy chủ và các đường lên 400GbE/800GbE tới xương sống. Cốt lõi của thiết kế này là không chỉ là một bộ điều hợp; đó là một công cụ hỗ trợ chiến lược cho trung tâm dữ liệu sẵn sàng cho AI, độ trễ cực thấp của tương lai., được triển khai trong mọi nút tính toán và lưu trữ trên toàn bộ mạng. Kiến trúc được xây dựng dựa trên sáu nguyên tắc chính:

  • Mạng Ethernet không mất mát: Tận dụng RoCE v2 với PFC (Kiểm soát luồng ưu tiên) và ECN (Thông báo tắc nghẽn rõ ràng) trên tất cả các bộ chuyển mạch để loại bỏ mất gói và đảm bảo độ trễ xác định cho lưu lượng RDMA.
  • GPUDirect RDMA: Cho phép giao tiếp GPU-tới-GPU trực tiếp qua mạng mà không cần sự tham gia của CPU, giảm độ trễ và giải phóng tài nguyên CPU cho các tác vụ tính toán.
  • Tăng tốc phần cứng ở mọi nơi: Tăng tốc các giao thức truyền tải, bảo mật (IPsec/MACsec) và lưu trữ cho bộ điều hợp, giải phóng chu kỳ CPU cho logic ứng dụng.
  • Dự phòng chủ động-chủ động: Sử dụng cả hai cổng QSFP112 ở chế độ liên kết tổng hợp (LACP) cho băng thông tổng hợp 400Gb/s và chuyển đổi dự phòng tự động với khả năng phục hồi dưới một giây.
  • Kỹ thuật lưu lượng thông minh: Định tuyến thích ứng và phân phối gói tin không theo thứ tự để tránh các điểm nóng tắc nghẽn và tối đa hóa việc sử dụng mạng.
  • Đo lường toàn diện: Đo lường mạng trong băng (INT) và giám sát theo luồng để phát hiện tắc nghẽn chủ động và lập kế hoạch dung lượng.

Giải pháp hoàn toàn tương thích MCX623106AN-CDAT với các nền tảng GPU NVIDIA (HGX, DGX) và các máy chủ CPU hàng đầu từ Dell, HPE, Supermicro và Lenovo. Đối với lưu trữ, kiến trúc hỗ trợ NVMe-oF qua RoCE với độ trễ dưới 15μs, cho phép lưu trữ phân tán được chia sẻ cho các cụm đào tạo quy mô lớn.

3. Vai trò & Tính năng chính của NVIDIA Mellanox MCX623106AN-CDAT

Là thành phần nền tảng của giải pháp này, NVIDIA Mellanox MCX623106AN-CDAT đóng bốn vai trò quan trọng trong kiến trúc:

Chức năng Chi tiết triển khai Lợi ích kinh doanh
Công cụ RDMA/RoCE RoCE v2 dựa trên phần cứng với ECN/PFC, độ trễ dưới 0,6μs, hỗ trợ GPUDirect Gần như không có sự tham gia của CPU; all-reduce nhanh hơn 8 lần cho đào tạo AI
200GbE hai cổng Hai cổng QSFP112 độc lập, thông lượng tổng hợp 400Gb/s Liên kết chủ động-chủ động cho băng thông; chủ động-chờ để dự phòng
Giao diện PCIe 5.0 PCIe 5.0 x16 (lên đến 32 GT/s) với công cụ DMA nâng cao Loại bỏ điểm nghẽn giao diện máy chủ cho lưu lượng 200GbE
Tăng tốc ảo hóa & lớp phủ SR-IOV với tối đa 512 VF trên mỗi cổng; tăng tốc VXLAN/NVGRE/IPsec/MACsec Đa người thuê mật độ cao với bảo mật và hiệu suất đường truyền

Các thông số kỹ thuật chính được trích xuất từ chính thức và cổng tài liệu mạng toàn diện của NVIDIA. Giấy trắng này đóng vai trò là nền tảng — kiến trúc đã được xác thực, các thành phần đã sẵn sàng sản xuất và lợi ích có thể đo lường được. bao gồm các khả năng tăng tốc toàn diện (checksum, LSO/LRO, xóa/chèn VLAN, RSS với tối đa 128 hàng đợi), các thuật toán kiểm soát tắc nghẽn nâng cao và hỗ trợ đầy đủ cho các thư viện giao tiếp tập thể của NVIDIA (NCCL). Thông số kỹ thuật MCX623106AN-CDAT cũng nêu bật hỗ trợ tương thích 100GbE và 50GbE, mang lại sự linh hoạt trong triển khai cho môi trường tốc độ hỗn hợp.

4. Khuyến nghị triển khai & mở rộng

Đối với các cụm AI mới, chúng tôi đề xuất cấu trúc liên kết lá-xương sống hai cấp với truy cập 200GbE và đường lên xương sống 800GbE. Mỗi máy chủ chứa một Card mạng Ethernet MCX623106AN-CDAT với cả hai cổng QSFP112 được kết nối với các bộ chuyển mạch lá riêng biệt để dự phòng. Mạng RoCE yêu cầu cấu hình QoS nhất quán trên tất cả các bộ chuyển mạch — đặc biệt, PFC trên ưu tiên 3 (cho lưu lượng tập thể RDMA) và ưu tiên 4 (cho lưu trữ), với đánh dấu ECN trên cùng các lớp lưu lượng. Chúng tôi khuyên bạn nên dành các VLAN riêng biệt cho RDMA, quản lý, lưu trữ và lưu lượng người thuê để đơn giản hóa việc giám sát và khắc phục sự cố.

Đối với môi trường hiện có với cơ sở hạ tầng 100GbE hiện có, giải pháp card mạng Ethernet MCX623106AN-CDAT cung cấp một lộ trình di chuyển mượt mà. Bởi vì bộ điều hợp tương thích ngược với quang QSFP56 100GbE, cáp hiện có có thể được tái sử dụng trong quá trình nâng cấp dần lên 200GbE. Bộ điều hợp cũng hỗ trợ chuyển mạch Ethernet tiêu chuẩn mà không cần bật RoCE bắt buộc, cho phép các nhóm triển khai phần cứng trước và kích hoạt khả năng RDMA theo từng giai đoạn khi mạng trưởng thành và khối lượng công việc biện minh cho việc chuyển đổi.

Mở rộng giải pháp vượt quá 500 nút đòi hỏi các cân nhắc bổ sung. Chúng tôi đề xuất triển khai chiến lược quản lý tắc nghẽn RoCE chuyên dụng bằng cách sử dụng các bộ chuyển mạch NVIDIA Spectrum-4 với đo lường tích hợp và điều chỉnh ngưỡng ECN động. Đối với các cụm vượt quá 1.000 nút, hãy xem xét triển khai bộ điều khiển mạng tập trung (ví dụ: NVIDIA NetQ) để duy trì khả năng hiển thị đầu cuối và tính nhất quán cấu hình tự động. MCX623106AN-CDAT để bán thông qua các đối tác kênh toàn cầu của NVIDIA bao gồm bảo hành toàn diện và hỗ trợ cập nhật firmware, đảm bảo độ tin cậy lâu dài ở quy mô lớn.

5. Vận hành, Giám sát, Khắc phục sự cố & Tối ưu hóa

Vận hành hiệu quả mạng RoCE đòi hỏi một chiến lược giám sát và khắc phục sự cố đa lớp:

  • Đo lường cấp bộ điều hợp: Thông số kỹ thuật MCX623106AN-CDAT bao gồm bộ đếm trên mỗi cổng cho các khung PFC, gói tin được đánh dấu ECN, khung bị bỏ qua, lỗi liên kết và các kỷ nguyên tắc nghẽn. Sử dụng mlx5cmd, ethtool, hoặc các công cụ firmware NVIDIA để xuất các chỉ số này tới bảng điều khiển Prometheus/Grafana với các cảnh báo thích hợp.
  • Đo lường mạng trong băng (INT): Tận dụng hỗ trợ INT của bộ điều hợp để theo dõi độ trễ trên mỗi luồng và độ sâu hàng đợi trên toàn bộ mạng, cho phép xác định chính xác các nguồn tắc nghẽn vi mô.
  • Giám sát cấp bộ chuyển mạch: Giám sát mức sử dụng bộ đệm, số lượng khung tạm dừng, độ sâu hàng đợi và tốc độ đánh dấu ECN trên các bộ chuyển mạch xương sống và lá. Sự gia tăng đột ngột về số lượng khung tạm dừng cho thấy tắc nghẽn vi mô có thể yêu cầu điều chỉnh ngưỡng ECN.
  • Chỉ số cấp ứng dụng: Đối với các ứng dụng RDMA, theo dõi độ trễ hoàn thành WR (Yêu cầu công việc), các sự kiện tràn CQ (Hàng đợi hoàn thành) và số lượng lỗi QP (Cặp hàng đợi) bằng cách sử dụng các thư viện NVIDIA libibverbs và rdma-core.

Các kịch bản khắc phục sự cố phổ biến và các hành động được đề xuất:

  • Suy giảm hiệu suất RoCE: Xác minh PFC được bật trên tất cả các cổng bộ chuyển mạch và đánh dấu DSCP khớp với cấu hình bộ chuyển mạch. Sử dụng chính thức và cổng tài liệu mạng toàn diện của NVIDIA. Giấy trắng này đóng vai trò là nền tảng — kiến trúc đã được xác thực, các thành phần đã sẵn sàng sản xuất và lợi ích có thể đo lường được. để xác thực cài đặt phân bổ bộ đệm so với các giá trị được đề xuất cho hồ sơ khối lượng công việc của bạn.
  • Chập chờn liên kết hoặc lỗi CRC: Kiểm tra chất lượng cáp QSFP112 (đảm bảo tuân thủ thông số kỹ thuật 200G AOC hoặc DAC) và xác minh rằng firmware bộ điều hợp đã được cập nhật lên phiên bản mới nhất.
  • Các vấn đề về hiệu suất GPU Direct: Xác nhận rằng GPUDirect đã được khởi tạo đúng cách và cấu trúc liên kết PCIe hỗ trợ DMA ngang hàng mà không cần chuyển mạch trung gian.
  • Khóa chết PFC hoặc bão hòa tạm dừng: Kiểm tra các ưu tiên được cấu hình sai và đảm bảo rằng PFC chỉ được bật trên các lớp lưu lượng RoCE (không bật trên lưu lượng quản lý hoặc lưu trữ).

Để tối ưu hóa, chúng tôi đề xuất các tham số điều chỉnh sau đây dựa trên xác nhận phòng thí nghiệm rộng rãi:

  • Gộp ngắt (điều tiết): Đặt thành 2–4 μs cho khối lượng công việc đào tạo AI để giảm thiểu độ trễ đồng thời duy trì hiệu quả CPU.
  • MTU RDMA: Tăng lên 4096 byte cho giao tiếp all-reduce để giảm chi phí giao thức và cải thiện thông lượng.
  • RSS (Receive Side Scaling): Cấu hình trên nhiều lõi CPU cho lưu lượng không phải RDMA để phân phối xử lý và tránh bão hòa lõi đơn.
  • Ngưỡng ECN: Đặt ngưỡng tối thiểu ở 40% bộ đệm và ngưỡng tối đa ở 75% cho lưu lượng ưu tiên 3, điều chỉnh dựa trên các mẫu tắc nghẽn đã quan sát và đặc điểm khối lượng công việc.

6. Tóm tắt & Đánh giá giá trị

Giải pháp NVIDIA Mellanox MCX623106AN-CDAT mang lại giá trị chuyển đổi cho các trung tâm dữ liệu quy mô AI hiện đại. Bằng cách thay thế TCP/IP dựa trên phần mềm bằng RDMA/RoCE và GPUDirect được tăng tốc phần cứng, các tổ chức có thể đạt được mức giảm độ trễ cấp ứng dụng từ 8–10 lần, cắt giảm chi phí xử lý mạng CPU hơn 85% và tăng mức sử dụng GPU từ dưới 70% lên trên 95%. Card mạng Ethernet MCX623106AN-CDAT cung cấp một con đường hiệu quả về chi phí để áp dụng 200GbE với bảo vệ đầu tư thông qua khả năng tương thích ngược với 100GbE và các khả năng tăng tốc sẵn sàng cho tương lai cho các khối lượng công việc mới nổi.

Khi đánh giá tổng chi phí sở hữu, giá MCX623106AN-CDAT được bù đắp bởi các khoản tiết kiệm hoạt động đáng kể: giảm thời gian đào tạo (tăng tốc thời gian đưa ra thị trường), giảm số lượng máy chủ (do sử dụng GPU cao hơn), giảm chi phí làm mát (nhờ <20W power draw), and elimination of separate InfiniBand fabrics. The solution is fully tương thích MCX623106AN-CDAT) với các ngăn xếp phần mềm AI và HPC chính, bao gồm NVIDIA NCCL, PyTorch, TensorFlow và các thư viện MPI, đảm bảo khả năng áp dụng rộng rãi trên các triển khai doanh nghiệp, đám mây và nghiên cứu.Để biết các tập lệnh triển khai chi tiết, mẫu cấu hình và báo cáo điểm chuẩn hiệu suất, vui lòng tham khảo

tờ dữ liệu MCX623106AN-CDAT chính thức và cổng tài liệu mạng toàn diện của NVIDIA. Giấy trắng này đóng vai trò là nền tảng — kiến trúc đã được xác thực, các thành phần đã sẵn sàng sản xuất và lợi ích có thể đo lường được. Card mạng PCIe bộ điều hợp MCX623106AN-CDAT ConnectX không chỉ là một bộ điều hợp; đó là một công cụ hỗ trợ chiến lược cho trung tâm dữ liệu sẵn sàng cho AI, độ trễ cực thấp của tương lai.