Tài liệu tham khảo kỹ thuật NVIDIA Mellanox 920-9B210-00FN-0D0: Tối ưu hóa kết nối độ trễ thấp 400Gb/s NDR
August 27, 2026
Tài liệu Tham khảo Kỹ thuật NVIDIA Mellanox 920-9B210-00FN-0D0: Tối ưu hóa Kết nối Độ trễ Thấp 400Gb/s NDR cho Các Cụm RDMA/HPC/AI
1. Bối cảnh Dự án & Phân tích Yêu cầu
Khi các cụm huấn luyện AI mở rộng từ hàng nghìn lên hàng chục nghìn GPU, và các mô phỏng HPC tiến gần đến hiệu suất Exascale, các kết nối mạng đối mặt với nhu cầu chưa từng có về băng thông, độ trễ và tính xác định. Việc chuyển đổi từ 200Gb/s HDR sang 400Gb/s NDR không còn là tùy chọn—đó là một yêu cầu chiến lược đối với các tổ chức triển khai các mô hình có hàng nghìn tỷ tham số và tính toán song song quy mô cực lớn. Trên nhiều môi trường triển khai hàng đầu, các yêu cầu cốt lõi có thể được tóm tắt như sau:
- Độ trễ cực thấp có tính xác định: Các giao tiếp tập thể MPI và all-to-all phải duy trì độ trễ từ cổng đến cổng dưới 100ns để giảm thiểu tác động của chi phí giao tiếp lên sự hội tụ của quá trình huấn luyện.
- Vải không mất mát ở quy mô lớn: Không có gói tin nào bị rơi trên hàng nghìn điểm cuối, đảm bảo hiệu suất RDMA không bị suy giảm khi tắc nghẽn.
- Tải tính toán trong mạng: Tải các phép toán tập thể (all-reduce, all-to-all, broadcast) lên lớp chuyển mạch để giải phóng tài nguyên CPU/GPU của máy chủ.
- Khả năng mở rộng radix cao: Hỗ trợ các cấu trúc cây béo (fat-tree) và dragonfly+ với băng thông phân đôi đầy đủ ở 8.000+ nút.
- Bảo vệ đầu tư: Tương thích liền mạch với cáp, quang và công cụ quản lý HDR hiện có để nâng cấp theo giai đoạn.
Để đáp ứng các yêu cầu này, giải pháp này áp dụng NVIDIA Mellanox 920-9B210-00FN-0D0 làm khối xây dựng cốt lõi—một bộ chuyển mạch InfiniBand 400Gb/s NDR được thiết kế chuyên dụng cho các triển khai cấp Exascale.
2. Thiết kế Kiến trúc Mạng Tổng thể
Giải pháp được đề xuất sử dụng cấu trúc lá-xương sống hai tầng, cung cấp một lớp mạng có thể mở rộng, không chặn với độ trễ xác định và cáp đơn giản hóa. Ở tầng lá, mỗi giá đỡ máy chủ được trang bị một hoặc hai đơn vị 920-9B210-00FN-0D0 InfiniBand switch OPN, cung cấp 64 cổng kết nối 400Gb/s NDR tới các máy chủ GPU thông qua cáp đồng trực tiếp OSFP (DAC) hoặc cáp quang chủ động (AOC). Ở tầng xương sống, một tầng thứ hai gồm các bộ chuyển mạch 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR kết nối tất cả các bộ chuyển mạch lá, tạo ra một lớp mạng cây béo có băng thông phân đôi đầy đủ.
Đối với các cụm vượt quá 5.000 nút, có thể triển khai kiến trúc Clos gấp ba tầng, với 920-9B210-00FN-0D0 đóng vai trò cả lá và xương sống để duy trì hiệu suất nhất quán trên tất cả các cấp độ. Bộ chuyển mạch hỗ trợ lên đến 64 bộ chuyển mạch trong một lớp mạng duy nhất dưới một trình quản lý mạng con, cho phép kiểm soát thống nhất các cấu trúc quy mô lớn.
Bảng sau đây tóm tắt các tham số mở rộng chính cho lớp mạng NDR 2 tầng được xây dựng xung quanh 920-9B210-00FN-0D0:
| Thành phần | Thông số kỹ thuật | Giá trị |
|---|---|---|
| Bộ chuyển mạch lá | 920-9B210-00FN-0D0 | 1–2 mỗi giá đỡ |
| Bộ chuyển mạch xương sống | 920-9B210-00FN-0D0 | N/2 (N = số bộ chuyển mạch lá) |
| Điểm cuối tối đa | Máy chủ GPU | Lên đến 4.096 (radix 64 cổng) |
| Băng thông phân đôi | Không chặn hoàn toàn | 51,2 Tb/s mỗi tầng xương sống |
3. Vai trò & Tính năng Chính của NVIDIA Mellanox 920-9B210-00FN-0D0
Trong kiến trúc này, NVIDIA Mellanox 920-9B210-00FN-0D0 đóng vai trò là phần tử chuyển mạch nền tảng, cung cấp nhiều khả năng quan trọng trực tiếp đáp ứng các yêu cầu được xác định trong Mục 1:
- 64 cổng 400Gb/s NDR: Mỗi cổng OSFP hỗ trợ 400Gb/s hai chiều với sửa lỗi chuyển tiếp (FEC) để kết nối tầm xa đáng tin cậy. Công suất chuyển mạch tổng cộng 51,2 Tb/s cung cấp đủ dung lượng ngay cả đối với các khối lượng công việc đòi hỏi giao tiếp cao nhất.
- Độ trễ cắt ngang cực thấp: Độ trễ từ cổng đến cổng dưới 100ns, như được ghi lại trong datasheet 920-9B210-00FN-0D0, đảm bảo chi phí tối thiểu cho các hoạt động MPI và RDMA.
- Tải tính toán tích hợp SHARPv3: Tải các phép toán tập thể khỏi CPU máy chủ, giảm độ trễ all-reduce tới 40% và all-to-all tới 35% trong các tác vụ quy mô lớn.
- Định tuyến thích ứng và kiểm soát tắc nghẽn: Tự động định tuyến lại lưu lượng truy cập để tránh các điểm nóng, duy trì hiệu suất có thể dự đoán được dưới các mẫu lưu lượng bất lợi. Viễn trắc nâng cao cung cấp khả năng hiển thị theo luồng và theo cổng để quản lý chủ động.
- Khả năng quản lý toàn diện: Tích hợp đầy đủ với Trình quản lý Vải Thống nhất (UFM) của NVIDIA để cung cấp không cần cấu hình, giám sát sức khỏe và chuyển đổi dự phòng tự động.
thông số kỹ thuật 920-9B210-00FN-0D0 cũng nhấn mạnh nguồn điện dự phòng kép, mô-đun quạt có thể thay nóng và hỗ trợ cấu hình trình quản lý mạng con dự phòng, đảm bảo tính khả dụng 99,999% cho các khối lượng công việc quan trọng.
4. Khuyến nghị Triển khai & Mở rộng
Đối với các tổ chức có kế hoạch áp dụng giải pháp 920-9B210-00FN-0D0 InfiniBand switch OPN, các hướng dẫn triển khai sau đây được khuyến nghị:
- Chiến lược cáp: Sử dụng cáp DAC OSFP-to-OSFP cho kết nối trong giá đỡ (lên đến 3m) và cáp quang AOC hoặc bộ thu phát quang cho các liên kết giữa các giá đỡ và lá-xương sống (lên đến 100m). Xác minh rằng tất cả các cáp đều tương thích với 920-9B210-00FN-0D0 theo ma trận tương thích của NVIDIA để tránh các vấn đề về tính toàn vẹn tín hiệu.
- Dự phòng: Triển khai nguồn điện kép được kết nối với các PDU riêng biệt. Sử dụng ít nhất hai bộ chuyển mạch xương sống cho mỗi lá để loại bỏ các điểm lỗi đơn lẻ. Đối với các khối lượng công việc quan trọng, hãy xem xét dự phòng N+1 ở tầng xương sống.
- Quản lý firmware: Đảm bảo tất cả các bộ chuyển mạch chạy các phiên bản firmware NVIDIA giống hệt nhau. Sử dụng tính năng nâng cấp firmware tự động của UFM để cập nhật theo luồng mà không bị gián đoạn. Xác thực tính tương thích của firmware với bộ điều hợp máy chủ và cáp trước khi triển khai.
- Lộ trình mở rộng: Đối với các cụm vượt quá 4.096 nút, chuyển sang cấu trúc Clos gấp ba tầng hoặc tận dụng dragonfly+ với định tuyến thích ứng. 920-9B210-00FN-0D0 hỗ trợ lên đến 64 bộ chuyển mạch trong một lớp mạng duy nhất, với nhiều lớp mạng được kết nối với nhau thông qua các cổng gateway cho các triển khai lớn hơn.
- Xác thực hiệu suất: Trước khi triển khai sản xuất, hãy chạy các bài kiểm tra tải toàn diện bằng cách sử dụng các điểm chuẩn hiệu suất của OFED (OpenFabrics Enterprise Distribution) để xác thực hiệu suất lớp mạng so với datasheet 920-9B210-00FN-0D0.
Khi tính toán tổng chi phí sở hữu, hãy tính đến số lượng tầng chuyển mạch giảm và cáp đơn giản hóa so với các giải pháp thay thế có radix thấp hơn. Mặc dù giá 920-9B210-00FN-0D0 trên mỗi đơn vị cao hơn các bộ chuyển mạch HDR, chi phí trên mỗi cổng và chi phí mạng trên mỗi GPU thấp hơn đáng kể trong các triển khai quy mô lớn, làm cho nó trở thành một lựa chọn hiệu quả về chi phí cho các dự án Exascale.
5. Vận hành, Giám sát & Khắc phục sự cố
Việc quản lý hiệu quả lớp mạng NDR đòi hỏi một khuôn khổ giám sát và khắc phục sự cố toàn diện. UFM của NVIDIA cung cấp một giao diện duy nhất cho toàn bộ NVIDIA Mellanox 920-9B210-00FN-0D0, cung cấp:
- Trực quan hóa cấu trúc liên kết: Tự động phát hiện và biểu diễn đồ họa của tất cả các bộ chuyển mạch, liên kết và điểm cuối với các cập nhật trạng thái thời gian thực.
- Bảng điều khiển hiệu suất: Chế độ xem thời gian thực về mức sử dụng cổng, tỷ lệ lỗi, chỉ báo tắc nghẽn và dung lượng bộ đệm trên toàn bộ lớp mạng.
- Cảnh báo chủ động: Báo động dựa trên ngưỡng cho suy giảm liên kết, bất thường nhiệt độ, lỗi nguồn điện và hao mòn cáp.
- Cô lập lỗi: Quy trình khắc phục sự cố có hướng dẫn xác định cáp, bộ thu phát hoặc cổng chuyển mạch bị lỗi, giảm thời gian trung bình để khắc phục (MTTR).
- Phân tích lịch sử: Phân tích xu hướng và lập kế hoạch dung lượng dựa trên dữ liệu hiệu suất lịch sử, cho phép đưa ra quyết định mở rộng chủ động.
Để khắc phục sự cố nâng cao, hãy tận dụng các công cụ chẩn đoán tích hợp của bộ chuyển mạch, bao gồm các bài kiểm tra loopback, phân tích BER (tỷ lệ lỗi bit) và giám sát chẩn đoán mô-đun quang (DOM). Các sự cố phổ biến gặp phải trong các triển khai NDR ban đầu bao gồm định tuyến không tối ưu do tốc độ liên kết không bằng nhau, loại cáp không khớp hoặc không nhất quán firmware. Kích hoạt định tuyến thích ứng, xác minh rằng tất cả các liên kết đang hoạt động ở 400Gb/s với FEC được bật và đảm bảo firmware nhất quán trên tất cả các bộ chuyển mạch sẽ giải quyết phần lớn các bất thường về hiệu suất.
Các kỹ sư mạng cũng nên thiết lập một đường cơ sở của thông số kỹ thuật 920-9B210-00FN-0D0 trong giai đoạn xác thực, bao gồm độ trễ, thông lượng và tỷ lệ lỗi dự kiến. Độ lệch khỏi đường cơ sở này có thể được sử dụng làm chỉ báo sớm về các sự cố tiềm ẩn. 920-9B210-00FN-0D0 InfiniBand switch OPN cũng hỗ trợ ghi nhật ký sự kiện toàn diện qua syslog và SNMP, cho phép tích hợp với các ngăn xếp giám sát trung tâm dữ liệu hiện có.
6. Tóm tắt & Đánh giá Giá trị
920-9B210-00FN-0D0 mang lại một đề xuất giá trị hấp dẫn cho các tổ chức xây dựng hoặc mở rộng các cụm HPC và AI dựa trên NDR. Nó cung cấp 64 cổng 400Gb/s NDR với độ trễ dưới 100ns, tải SHARPv3, khả năng quản lý cấp doanh nghiệp và khả năng tương thích hoàn toàn với hệ sinh thái HDR hiện có—tất cả trong một nền tảng 1U nhỏ gọn. Các điểm giá trị chính bao gồm:
- Hiệu suất: Giảm tới 75% độ trễ giao tiếp all-to-all và giảm tới 40% độ trễ all-reduce thông qua tải SHARPv3 và băng thông NDR.
- Hiệu quả chi phí: Chi phí mạng trên mỗi GPU thấp hơn so với các giải pháp thay thế HDR trong các triển khai quy mô lớn, nhờ radix cao hơn và số lượng tầng chuyển mạch giảm.
- Đơn giản hóa vận hành: Tích hợp sâu với UFM để quản lý thống nhất, cung cấp tự động, giám sát chủ động và khắc phục sự cố nhanh chóng.
- Bảo vệ đầu tư: Tương thích hoàn toàn với cáp, quang và ngăn xếp phần mềm HDR hiện có, cho phép nâng cấp theo giai đoạn mà không làm gián đoạn khối lượng công việc sản xuất.
- Khả năng mở rộng trong tương lai: Hỗ trợ các cấu trúc Clos gấp ba tầng và dragonfly+, đảm bảo lớp mạng có thể mở rộng lên hơn 8.000 nút khi nhu cầu tính toán tăng lên.
Đối với các tổ chức đang đánh giá 920-9B210-00FN-0D0 để bán thông qua các đối tác kênh của NVIDIA, chúng tôi khuyên bạn nên xem xét datasheet 920-9B210-00FN-0D0 chi tiết và tương tác với một kiến trúc sư giải pháp được chứng nhận để xác thực thiết kế cho khối lượng công việc và yêu cầu quy mô cụ thể của bạn. NVIDIA Mellanox 920-9B210-00FN-0D0 đã sẵn sàng cho sản xuất ngày hôm nay, cung cấp nền tảng kết nối hiệu suất cao, có thể mở rộng cho thế hệ đổi mới AI và HPC tiếp theo.

