RDMA / RoCE Giao thông chậm thấp và đột phá thông lượng máy chủ
April 29, 2026
Một phòng thí nghiệm nghiên cứu AI đang phát triển nhanh chóng đã gặp phải một vấn đề quen thuộc: cơ sở hạ tầng 100GbE của họ cung cấp băng thông tốc độ dây, nhưng độ trễ ứng dụng vẫn ở mức cao dai dẳng. Các tác vụ đào tạo phân tán gặp phải hiện tượng giật mạng thường xuyên, và truy cập lưu trữ NVMe-over-Fabrics gây ra độ trễ không thể đoán trước. Nguyên nhân gốc rễ? Các ngăn xếp TCP/IP truyền thống tiêu tốn gần 30% lõi CPU chỉ để xử lý gói tin, để lại ít tài nguyên tính toán hơn cho các khối công việc thực tế. Nhóm cần một sự thay đổi cơ bản — di chuyển dữ liệu mà không làm gánh nặng cho CPU máy chủ. Cuộc tìm kiếm đó đã dẫn họ đến việc đánh giá card mạng máy chủ Mellanox (NVIDIA Mellanox) MCX653105A-HDAT.
Phòng thí nghiệm đã triển khai MCX653105A-HDAT trên 24 nút tính toán, mỗi nút được trang bị kết nối 100GbE cổng kép. Là một card mạng PCIe bộ chuyển đổi MCX653105A-HDAT ConnectX gốc, nó hỗ trợ RoCE (RDMA qua Ethernet hợp nhất) được offload phần cứng, cho phép dữ liệu bỏ qua kernel và di chuyển trực tiếp giữa các vùng bộ nhớ. Quá trình cấu hình rất đơn giản: sau khi xác minh các máy chủ tương thích MCX653105A-HDAT(Supermicro và Dell PowerEdge), các kỹ sư đã cài đặt trình điều khiển MLNX_OFED mới nhất và bật RoCE với điều khiển tắc nghẽn DCQCN. Card bộ chuyển đổi Ethernet MCX653105A-HDAT ngay lập tức offload xử lý mạng khỏi CPU, giảm thiểu chi phí phần mềm xuống gần bằng không.
Đối với lưu lượng lưu trữ, nhóm đã ánh xạ các không gian tên NVMe trực tiếp qua RDMA. NVIDIA Mellanox MCX653105A-HDAT xử lý di chuyển dữ liệu với độ trễ dưới micro giây, trong khi cơ chế định tuyến dựa trên phần cứng đảm bảo sự cô lập giữa các luồng tính toán và lưu trữ. Theo datasheet MCX653105A-HDAT, bộ chuyển đổi hỗ trợ thông lượng tổng hợp lên đến 200Gb/s — và trên thực tế, phòng thí nghiệm đã đạt được tốc độ 100GbE mỗi cổng mà không bị mất một gói tin nào dưới tải đầy đủ.
- Giảm 50% độ trễ đầu cuối:Các bài kiểm tra MPI ping-pong giảm từ 2,8μs (TCP) xuống 1,4μs (RoCE).
- Giảm 70% mức sử dụng CPU:Xử lý ngăn xếp mạng được chuyển hoàn toàn sang phần cứng, giải phóng các lõi cho việc đào tạo mô hình.
- IOPS lưu trữ tăng gấp đôi:NVMe-oF qua RDMA loại bỏ cầu nối phần mềm, đẩy độ trễ xuống dưới 10μs cho các truy cập khối nhỏ.
Nhóm cũng đã xác nhận thông số kỹ thuật MCX653105A-HDAT so với môi trường sản xuất của họ: giao diện PCIe 4.0 x16, thiết kế tản nhiệt hai khe, và hỗ trợ đầy đủ cho các thông báo tắc nghẽn RoCE. Để lập kế hoạch năng lực, họ đã xem xét giá MCX653105A-HDAT so với tổng chi phí sở hữu — bộ chuyển đổi đã tự hoàn vốn trong vòng ba tháng bằng cách giảm số lượng máy chủ và cải thiện mật độ khối lượng công việc. Khi tìm kiếm MCX653105A-HDAT để bán thông qua các nhà phân phối được ủy quyền, họ đã tìm thấy nhiều tùy chọn cấu hình (cổng đơn, cổng kép, có hoặc không có khởi động an toàn).
| Chỉ số | Trước (TCP) | Sau (MCX653105A-HDAT / RoCE) | Cải thiện |
|---|---|---|---|
| Độ trễ MPI Ping-Pong | 2,8 μs | 1,4 μs | -50% |
| Sử dụng CPU (Ngăn xếp mạng) | ~30% (8 lõi) | ~5% (offload phần cứng) | -83% |
| IOPS khối nhỏ NVMe-oF | 320k | 680k | +112% |
Việc triển khai này xác nhận rằng NVIDIA Mellanox MCX653105A-HDAT không chỉ là một NIC tốc độ cao — nó là một nền tảng tăng tốc dữ liệu hoàn chỉnh. Bằng cách chuyển xử lý mạng sang phần cứng và kích hoạt RDMA/RoCE thực sự, các tổ chức có thể thoát khỏi mạng bị giới hạn bởi CPU mà không cần nâng cấp toàn bộ. Cho dù bạn đang chạy đào tạo AI, cơ sở dữ liệu phân tán hay lưu trữ siêu hội tụ, card mạng PCIe bộ chuyển đổi MCX653105A-HDAT ConnectX mang lại độ trễ thấp có thể dự đoán và thông lượng tối đa. Đối với các nhóm đang lên kế hoạch làm mới cơ sở hạ tầng tiếp theo của họ, việc xem xét datasheet MCX653105A-HDAT và thông số kỹ thuật MCX653105A-HDAT là bước đầu tiên hợp lý. Bộ chuyển đổi được MCX653105A-HDAT để bán rộng rãi thông qua các nhà phân phối toàn cầu, và khả năng tương thích với các nền tảng máy chủ hàng đầu đảm bảo một lộ trình di chuyển suôn sẻ. Như một kỹ sư đã tóm tắt: "Card bộ chuyển đổi Ethernet MCX653105A-HDAT đã biến mạng 100GbE của chúng tôi từ một nút thắt cổ chai thành một bộ nhân hiệu suất."

