NVIDIA Mellanox MQM9790-NS2F Tài liệu kỹ thuật: Tối ưu hóa kết nối độ trễ thấp cho các cụm RDMA/HPC/AI
August 24, 2026
Tài liệu Tham khảo Kỹ thuật NVIDIA Mellanox MQM9790-NS2F: Tối ưu hóa Kết nối Độ trễ Thấp cho Các Cụm RDMA/HPC/AI
1. Bối cảnh Dự án & Phân tích Yêu cầu
Các khối lượng công việc đào tạo AI hiện đại và mô phỏng HPC được đặc trưng bởi các mẫu giao tiếp cường độ cao, tất cả-với-tất cả, đặt ra yêu cầu cực kỳ khắt khe đối với mạng lưới nền tảng. Khi các cụm GPU mở rộng vượt quá 1.000 nút, phương pháp truyền thống dựa vào Ethernet với kiểm soát tắc nghẽn dựa trên phần mềm tỏ ra không đủ. Các yêu cầu chính xuất phát từ các môi trường này bao gồm:
- Độ trễ cực thấp, có thể xác định: Độ trễ cổng-tới-cổng dưới micro giây để giảm thiểu thời gian hoàn thành công việc MPI.
- Mạng lưới không mất mát: Không có gói tin nào bị rơi khi tắc nghẽn để ngăn chặn TCP incast và sự sụp đổ hiệu suất.
- Tải tính toán trong mạng: Giảm tải CPU máy chủ cho các hoạt động tập thể (ví dụ: all-reduce, broadcast).
- Cấu trúc liên kết có thể mở rộng: Hỗ trợ cấu trúc fat-tree và dragonfly+ với băng thông phân đôi đầy đủ lên đến hàng nghìn điểm cuối.
NVIDIA Mellanox MQM9790-NS2F được thiết kế để đáp ứng các yêu cầu này với tư cách là một switch InfiniBand NDR 400Gb/s với 64 cổng OSFP, mang lại mật độ và hiệu suất cần thiết cho các triển khai cấp exascale.
2. Thiết kế Kiến trúc Mạng Tổng thể
Giải pháp được đề xuất sử dụng cấu trúc liên kết lá-xương sống hai tầng, cung cấp sự cân bằng giữa khả năng mở rộng, kiểm soát quá tải và sự đơn giản trong cáp. Ở tầng lá, mỗi giá đỡ máy tính chứa một hoặc hai đơn vị MQM9790-NS2F InfiniBand switch, cung cấp 64 cổng kết nối 400Gb/s tới các máy chủ GPU. Ở tầng xương sống, một tầng thứ hai của các switch MQM9790-NS2F kết nối tất cả các lá, tạo ra một mạng lưới không bị chặn.
Đối với các triển khai quy mô lớn vượt quá 2.000 nút GPU, có thể áp dụng kiến trúc Clos gấp ba tầng, với MQM9790-NS2F 400Gb/s NDR 64-port OSFP đóng vai trò cả lá và xương sống để duy trì hiệu suất nhất quán trên tất cả các cấp độ. Thiết kế này đảm bảo rằng bất kỳ máy chủ nào cũng có thể giao tiếp với bất kỳ máy chủ nào khác ở tốc độ đường truyền, với tối đa ba lần nhảy switch.
Bảng sau đây tóm tắt các tham số mở rộng điển hình cho mạng lá-xương sống 2 tầng được xây dựng xung quanh MQM9790-NS2F:
| Thành phần | Thông số kỹ thuật | Giá trị |
|---|---|---|
| Switch lá | MQM9790-NS2F mỗi giá đỡ | 1–2 đơn vị |
| Switch xương sống | MQM9790-NS2F | N/2 (trong đó N = số lượng switch lá) |
| Điểm cuối tối đa | Máy chủ GPU mỗi mạng lưới | Lên đến 4.096 |
| Băng thông phân đôi | Không chặn hoàn toàn | 51,2 Tb/s mỗi tầng xương sống |
3. Vai trò & Tính năng Chính của NVIDIA Mellanox MQM9790-NS2F
Trong kiến trúc này, NVIDIA Mellanox MQM9790-NS2F đóng vai trò là khối xây dựng nền tảng, cung cấp một số khả năng quan trọng:
- 400Gb/s NDR mỗi cổng: Mỗi cổng OSFP trong số 64 cổng hỗ trợ 400Gb/s hai chiều, với sửa lỗi chuyển tiếp (FEC) để kết nối tầm xa đáng tin cậy.
- SHARPv3 tích hợp (Giao thức Tích lũy và Giảm bậc thang có thể mở rộng): Tải các hoạt động giao tiếp tập thể khỏi CPU máy chủ, giảm độ trễ all-reduce MPI tới 40% trong các công việc quy mô lớn.
- Định tuyến thích ứng và kiểm soát tắc nghẽn: Định tuyến lại lưu lượng truy cập động để tránh các điểm nóng, đảm bảo hiệu suất có thể dự đoán được ngay cả dưới các mẫu lưu lượng truy cập bất lợi.
- Phân tích từ xa nâng cao: Bộ đếm mỗi luồng và mỗi cổng, cùng với giám sát mức sử dụng bộ đệm, cung cấp khả năng hiển thị sâu về tình trạng mạng lưới.
Theo tờ dữ liệu MQM9790-NS2F, switch cung cấp độ trễ cắt ngang dưới 100ns và hỗ trợ dung lượng chuyển mạch tổng cộng lên tới 51,2 Tb/s. Các thông số kỹ thuật này làm cho nó trở thành một lựa chọn lý tưởng cho cả các triển khai mới và nâng cấp theo giai đoạn từ cơ sở hạ tầng HDR (200Gb/s).
4. Khuyến nghị Triển khai & Khả năng mở rộng
Đối với các tổ chức có kế hoạch áp dụng Giải pháp switch InfiniBand MQM9790-NS2F, các hướng dẫn triển khai sau đây được khuyến nghị:
- Chiến lược cáp: Sử dụng cáp đồng gắn trực tiếp OSFP-to-OSFP (DAC) cho kết nối trong giá đỡ (lên đến 3m) và cáp quang chủ động (AOC) hoặc bộ thu phát quang cho các liên kết giữa các giá đỡ và liên kết xương sống-lá (lên đến 100m).
- Dự phòng: Triển khai bộ nguồn kép và mô-đun quạt có thể thay nóng. Kết nối mỗi bộ nguồn với các PDU riêng biệt để chịu lỗi.
- Tính nhất quán của phần mềm: Đảm bảo tất cả các switch chạy cùng một phiên bản phần mềm NVIDIA để tránh sự không khớp tính năng. Sử dụng tính năng nâng cấp phần mềm tự động của UFM để cập nhật theo giai đoạn.
- Khả năng mở rộng: Đối với các cụm vượt quá 4.000 nút, hãy xem xét cấu trúc Clos gấp ba tầng hoặc dragonfly+ với định tuyến thích ứng được bật. Hệ sinh thái tương thích MQM9790-NS2F bao gồm nhiều loại quang học và cáp để hỗ trợ các cấu trúc liên kết này.
Khi tính toán tổng chi phí sở hữu, hãy tính đến số lượng tầng switch giảm và cáp đơn giản hóa so với các giải pháp có radix thấp hơn. Mặc dù giá MQM9790-NS2F mỗi đơn vị cao hơn các switch thế hệ trước, chi phí mỗi cổng và chi phí mạng mỗi GPU thấp hơn đáng kể trong các triển khai quy mô lớn, làm cho nó trở thành một lựa chọn hiệu quả về chi phí cho các dự án Exascale.
5. Vận hành, Giám sát & Khắc phục sự cố
Quản lý hiệu quả mạng lưới NDR đòi hỏi một khuôn khổ giám sát và khắc phục sự cố toàn diện. Trình quản lý Fabric Thống nhất (UFM) của NVIDIA cung cấp một cửa sổ duy nhất cho toàn bộ mạng lưới dựa trên NVIDIA Mellanox MQM9790-NS2F, cung cấp:
- Trực quan hóa cấu trúc liên kết: Tự động phát hiện và biểu diễn đồ họa của tất cả các switch, liên kết và điểm cuối.
- Bảng điều khiển hiệu suất: Chế độ xem thời gian thực về mức sử dụng cổng, tỷ lệ lỗi và các chỉ báo tắc nghẽn.
- Cảnh báo chủ động: Cảnh báo dựa trên ngưỡng cho suy giảm liên kết, bất thường nhiệt độ và lỗi bộ nguồn.
- Cô lập lỗi: Quy trình khắc phục sự cố có hướng dẫn xác định cáp, bộ thu phát hoặc cổng switch bị lỗi.
Để khắc phục sự cố nâng cao, thông số kỹ thuật MQM9790-NS2F bao gồm giám sát bộ đệm chi tiết và thống kê cấp luồng có thể được xuất qua API REST để tích hợp với các ngăn xếp giám sát tùy chỉnh. Kỹ sư mạng cũng nên tận dụng các công cụ chẩn đoán tích hợp của switch, chẳng hạn như kiểm tra vòng lặp và phân tích BER (tốc độ lỗi bit), để xác thực tính toàn vẹn của liên kết trước khi triển khai khối lượng công việc sản xuất.
Các sự cố phổ biến gặp phải trong các lần triển khai ban đầu bao gồm định tuyến không tối ưu do tốc độ liên kết không bằng nhau hoặc loại cáp không khớp. Bật định tuyến thích ứng và xác minh rằng tất cả các liên kết đang hoạt động ở 400Gb/s (với FEC được bật) sẽ giải quyết phần lớn các bất thường về hiệu suất. Giải pháp switch InfiniBand MQM9790-NS2F cũng bao gồm hỗ trợ cho tính dự phòng của trình quản lý mạng con, đảm bảo rằng việc cấu hình lại mạng lưới có thể xảy ra mà không cần sự can thiệp thủ công trong trường hợp nút quản lý bị lỗi.
6. Tóm tắt & Đánh giá Giá trị
MQM9790-NS2F đại diện cho một bước tiến đáng kể trong mạng hiệu suất cao, cung cấp băng thông NDR 400Gb/s, mật độ 64 cổng và tăng tốc tính toán trong mạng trong một nền tảng 1U duy nhất, có thể quản lý được. Đối với các kiến trúc sư và kỹ sư thiết kế các cụm AI và HPC, switch này cung cấp một con đường đã được chứng minh để đạt hiệu suất exascale, cho phép:
- Giảm tới 30% thời gian hoàn thành công việc cho các khối lượng công việc đào tạo quy mô lớn thông qua việc tải SHARPv3.
- TCO thấp hơn so với các giải pháp thay thế, được thúc đẩy bởi radix cao hơn và số lượng tầng switch giảm.
- Hoạt động đơn giản hóa thông qua tích hợp UFM và phân tích từ xa toàn diện để quản lý lỗi chủ động.
- Khả năng mở rộng trong tương lai để hỗ trợ các kết nối GPU và bộ tăng tốc thế hệ tiếp theo.
Đối với các tổ chức đang đánh giá MQM9790-NS2F để bán thông qua mạng lưới đối tác của NVIDIA, chúng tôi khuyên bạn nên xem lại tờ dữ liệu MQM9790-NS2F chi tiết và tương tác với một kiến trúc sư giải pháp được chứng nhận để điều chỉnh việc triển khai cho phù hợp với khối lượng công việc và yêu cầu quy mô cụ thể của bạn. NVIDIA Mellanox MQM9790-NS2F đã sẵn sàng để phục vụ như là xương sống kết nối hiệu suất cao cho thập kỷ tiếp theo của khám phá khoa học và đổi mới AI.

