NVIDIA Mellanox MCX631432AN-ADAB hoạt động: RDMA / RoCE Giao thông chậm và tối ưu hóa hiệu suất máy chủ
July 28, 2026
NVIDIA Mellanox MCX631432AN-ADAB hoạt động: RDMA / RoCE Giao thông chậm và tối ưu hóa hiệu suất máy chủ
Bối cảnh & Thách thức: Chế độ tắc nghẽn mạng trong một cụm đào tạo AI
Một công ty fintech hàng đầu gần đây đã triển khai một cụm AI dựa trên GPU 64-node được thiết kế cho đào tạo chiến lược giao dịch tần số cao, với mỗi máy chủ được trang bị lưu trữ NVMe hiệu suất cao.,sau khi đưa vào hoạt động, thông lượng đào tạo thực tế giảm đáng kể so với mong đợi.Phân tích sau khi triển khai cho thấy cấu trúc giao tiếp giữa các nút dựa trên TCP/IP 10GbE đã trở thành nút thắt chínhAll-Reduce hoạt động truyền thông tập thể thể hiện độ trễ cao đến 4 ¢ 5 milliseconds,trong khi chi phí CPU cho xử lý giao thức mạng vượt quá 40% Đội ngũ khẩn cấp cần một giải pháp mạng có thể giảm đáng kể thời gian trễ liên lạc và phục hồi dung lượng tính toán CPU.
Giải pháp và triển khai: Xây dựng một mạng lưới không mất mát RoCE với MCX631432AN-ADAB
Sau một đánh giá kỹ thuật toàn diện, nhóm đã chọnNVIDIA Mellanox MCX631432AN-ADABMỗi máy chủ được trang bị mộtMCX631432AN-ADAB ConnectX-6 Lx cổng kép 25GbE SFP28Bộ chuyển đổi, với cả hai cổng SFP28 được kết nối với các công tắc NVIDIA Spectrum-3 dư thừa để thiết lập một kiến trúc có sẵn cao.
Việc triển khai được thực hiện trong ba giai đoạn riêng biệt:
- Giai đoạn 1 ¢ thí điểm (8 nút):Nhóm đã lắp đặtMCX631432AN-ADAB thẻ chuyển đổi Ethernettrên một tập hợp con của máy chủ GPU, cấu hình RoCEv2 với Priority Flow Control (PFC) và Explicit Congestion Notification (ECN) để tạo ra một cấu trúc Ethernet không mất mát.NCCL (NVIDIA Collective Communications Library) được biên dịch lại với hỗ trợ RDMA.
- Giai đoạn 2 - Điều chỉnh và xác nhận:Sử dụng dữ liệu đo từ xa chi tiết trongBảng dữ liệu MCX631432AN-ADAB, nhóm tinh chỉnh các tham số DCB và ngưỡng đệm để loại bỏ các cơn bão tạm dừng PFC trong khi duy trì mất gần không gói.MCX631432AN-ADAB thông số kỹ thuậthướng dẫn tối ưu hóa sự điều chỉnh ngắt và chiều sâu hàng đợi cho hồ sơ khối lượng công việc cụ thể.
- Giai đoạn 3 ️ Việc triển khai sản xuất đầy đủ (64 nút):Sau khi xác nhận thành công, các nút còn lại đã được di chuyển sang bộ chuyển đổi mới.MCX631432AN-ADAB tương thíchtrình điều khiển tích hợp liền mạch với môi trường dựa trên Ubuntu hiện có và ngăn xếp Mellanox OFED.
Nhóm đã lưu ý rằngMCX631432AN-ADAB giải pháp card adapter Ethernetcung cấp một con đường di chuyển đơn giản, vì các bộ điều hợp hoàn toàn tương thích với cơ sở hạ tầng cáp và chuyển mạch SFP28 hiện có của họ, loại bỏ sự cần thiết phải nâng cấp phụ trợ tốn kém.
Kết quả & Lợi ích: Chuyển đổi có thể đo lường trong độ trễ và thông lượng
Các lợi ích hiệu suất đạt được thông quaNVIDIA Mellanox MCX631432AN-ADABBảng dưới đây tóm tắt các số liệu chính trước và sau khi nâng cấp:
| Phương pháp đo | Đăng cấp trước (10GbE TCP/IP) | Sau khi nâng cấp (MCX631432AN-ADAB với RoCE) | Cải thiện |
|---|---|---|---|
| All-Reduce Latency (trung bình) | 4.7 ms | 0.32 ms | 14.7 × giảm |
| Sử dụng CPU mạng (mỗi nút) | 42% | 9% | 33 pp giải phóng |
| Sử dụng GPU (giai đoạn tải dữ liệu) | 61% | 89% | +28% |
| Công suất đào tạo cụm | 1.8x đường cơ bản | 4.3x đường cơ bản | 2.4 lần tăng |
Ngoài những lợi ích định lượng này, nhóm đã quan sát thấy những cải tiến hoạt động trực tiếp ảnh hưởng đến năng suất của nhà phát triển.Các chương trình huấn luyện mô hình trước đây chỉ mất 36 giờ chỉ trong 15 giờ, cho phép các chu kỳ lặp lại thường xuyên hơn. Việc giảm tải NVMe-oF dựa trên phần cứng cũng làm giảm độ trễ truy cập lưu trữ 35%, tăng tốc các hoạt động điểm kiểm tra dữ liệu chuyên sâu hơn.Đối với các tổ chức đánh giá trường hợp kinh doanh,Giá MCX631432AN-ADABđã được chứng minh là rất cạnh tranh khi được đo so sánh với mức tăng thông lượng 2,4 lần và khả năng trì hoãn việc mua lại máy chủ GPU bổ sung.MCX631432AN-ADAB để báncác gói với chuyển đổi NVIDIA Spectrum cung cấp con đường hiệu quả nhất về chi phí cho việc mở rộng quy mô trong tương lai.
Tóm lại & triển vọng: Một nền tảng cho đổi mới khối lượng công việc tương lai
Việc triển khai sản xuất này chứng minh rằngNVIDIA Mellanox MCX631432AN-ADABlà nhiều hơn một bản cập nhật mạng thông thường ∙ nó là một yếu tố cơ sở hạ tầng biến đổi mở ra toàn bộ tiềm năng của máy tính GPU tăng tốc hiện đại.Sự kết hợp của băng thông tổng cộng 50 Gb/s, độ trễ liên lạc tập thể dưới 0,4ms, và khả năng giảm tải CPU đáng kể đặt bộ chuyển đổi này như một sự lựa chọn lý tưởng cho các tổ chức chạy AI phân tán, HPC,và khối lượng phân tích thời gian thực.
Nhìn về phía trước, nhóm fintech đang khám phá sự tích hợp với NVIDIA DOCA để tăng tốc độ lập trình đường dẫn dữ liệu hơn nữa và thực hiện việc cung cấp không chạm cho việc mở rộng cụm trong tương lai.Họ cũng đang đánh giá khả năng đo từ xa của bộ chuyển đổiBảng dữ liệu MCX631432AN-ADAB✓ xây dựng các mô hình quản lý tắc nghẽn dự đoán.MCX631432AN-ADAB giải pháp card adapter Ethernettiếp tục chứng minh giá trị của nó, công ty có kế hoạch tiêu chuẩn hóa trên nền tảng này cho tất cả các khoản đầu tư cơ sở hạ tầng trong tương lai,tin tưởng rằng nó cung cấp một nền tảng vững chắc và có thể mở rộng cho thế hệ tiếp theo của các ứng dụng tài chính dựa trên AI.

