Tài liệu tham khảo kỹ thuật NVIDIA Mellanox 920-9B210-00FN-0D0: Tối ưu hóa kết nối độ trễ thấp 400Gb/s NDR

August 26, 2026

Tài liệu tham khảo kỹ thuật NVIDIA Mellanox 920-9B210-00FN-0D0: Tối ưu hóa kết nối độ trễ thấp 400Gb/s NDR

Tài liệu Tham khảo Kỹ thuật NVIDIA Mellanox 920-9B210-00FN-0D0: Tối ưu hóa Kết nối Độ trễ Thấp 400Gb/s NDR cho Các Cụm RDMA/HPC/AI

1. Bối cảnh Dự án & Phân tích Yêu cầu

Khi các cụm huấn luyện AI vượt quá 4.000 GPU và các mô phỏng HPC tiến gần đến hiệu suất exascale, các mạng lưới đối mặt với nhu cầu chưa từng có về băng thông, độ trễ và tính xác định. Việc chuyển đổi từ 200Gb/s HDR sang 400Gb/s NDR không còn là tùy chọn cho các tổ chức nhắm đến các mô hình có nghìn tỷ tham số hoặc các mô phỏng thời tiết quy mô km — đó là một yêu cầu chiến lược. Các yêu cầu chính được xác định trong các triển khai nghiên cứu và doanh nghiệp hàng đầu bao gồm:

  • Độ trễ xác định cực thấp: Độ trễ từ cổng đến cổng dưới 100ns để giảm thiểu chi phí truyền thông MPI và all-to-all.
  • Mạng lưới không mất mát ở quy mô lớn: Không có gói tin nào bị rơi khi tắc nghẽn trên hàng nghìn điểm cuối, đảm bảo hiệu suất RDMA luôn có thể dự đoán được.
  • Tải tính toán trong mạng: Tải các phép toán tập thể (all-reduce, all-to-all, broadcast) lên mạng lưới để tối đa hóa việc sử dụng GPU.
  • Khả năng mở rộng radix cao: Hỗ trợ các cấu trúc cây béo (fat-tree) và dragonfly+ quy mô lớn với băng thông phân chia đầy đủ lên đến hơn 8.000 nút.
  • Bảo vệ đầu tư: Tương thích liền mạch với cáp, quang học và công cụ quản lý HDR hiện có để cho phép nâng cấp theo giai đoạn.

Để đáp ứng các yêu cầu này, giải pháp này áp dụng NVIDIA Mellanox 920-9B210-00FN-0D0 làm khối xây dựng cốt lõi — một switch InfiniBand 400Gb/s NDR cung cấp mật độ, hiệu suất và trí thông minh cần thiết cho các triển khai cấp exascale.

2. Thiết kế Kiến trúc Mạng Tổng thể

Giải pháp được đề xuất sử dụng cấu trúc lá-xương sống hai tầng, cung cấp một mạng lưới có thể mở rộng, không bị chặn với độ trễ xác định và cáp đơn giản hóa. Ở tầng lá, mỗi giá đỡ máy tính được trang bị một hoặc hai đơn vị OPN switch InfiniBand 920-9B210-00FN-0D0, cung cấp 64 cổng kết nối 400Gb/s NDR tới các máy chủ GPU thông qua cáp đồng gắn trực tiếp OSFP-to-OSFP (DAC) hoặc cáp quang chủ động (AOC). Ở tầng xương sống, một tầng thứ hai gồm các switch 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR kết nối tất cả các switch lá, tạo ra một mạng lưới cây béo có băng thông phân chia đầy đủ.

Đối với các cụm vượt quá 5.000 nút, có thể triển khai kiến trúc Clos gấp ba tầng, với 920-9B210-00FN-0D0 đóng vai trò cả lá và xương sống để duy trì hiệu suất nhất quán ở tất cả các cấp độ. Switch hỗ trợ lên đến 64 switch trong một mạng lưới duy nhất dưới một trình quản lý mạng con, cho phép kiểm soát thống nhất các cấu trúc quy mô lớn.

Bảng sau đây tóm tắt các tham số mở rộng chính cho mạng lưới NDR 2 tầng được xây dựng xung quanh 920-9B210-00FN-0D0:

Thành phần Thông số kỹ thuật Giá trị
Switch lá 920-9B210-00FN-0D0 1–2 mỗi giá đỡ
Switch xương sống 920-9B210-00FN-0D0 N/2 (N = số lượng switch lá)
Điểm cuối tối đa Máy chủ GPU Lên đến 4.096 (radix 64 cổng)
Băng thông phân chia Không chặn hoàn toàn 51,2 Tb/s mỗi tầng xương sống

3. Vai trò & Tính năng Chính của NVIDIA Mellanox 920-9B210-00FN-0D0

Trong kiến trúc này, NVIDIA Mellanox 920-9B210-00FN-0D0 đóng vai trò là phần tử chuyển mạch nền tảng, cung cấp nhiều khả năng quan trọng trực tiếp đáp ứng các yêu cầu được xác định trong Mục 1:

  • 64 cổng 400Gb/s NDR: Mỗi cổng OSFP hỗ trợ 400Gb/s hai chiều với sửa lỗi chuyển tiếp (FEC) để kết nối tầm xa đáng tin cậy. Công suất chuyển mạch tổng cộng 51,2 Tb/s cung cấp đủ khả năng cho ngay cả các khối lượng công việc đòi hỏi giao tiếp cao nhất.
  • Độ trễ cắt lát cực thấp: Độ trễ từ cổng đến cổng dưới 100ns, như được ghi lại trong datasheet 920-9B210-00FN-0D0, đảm bảo chi phí tối thiểu cho các hoạt động MPI và RDMA.
  • Tích hợp SHARPv3 (Giao thức Tích hợp và Giảm bậc thang có thể mở rộng): Tải các phép toán tập thể khỏi CPU máy chủ, giảm độ trễ all-reduce tới 40% và all-to-all tới 35% trong các tác vụ quy mô lớn.
  • Định tuyến thích ứng và kiểm soát tắc nghẽn: Định tuyến lại lưu lượng truy cập động để tránh các điểm nóng, đảm bảo hiệu suất có thể dự đoán được dưới các mẫu lưu lượng truy cập bất lợi. Viễn trắc nâng cao cung cấp khả năng hiển thị theo luồng và theo cổng để quản lý chủ động.
  • Khả năng quản lý toàn diện: Tích hợp đầy đủ với Trình quản lý Vải Thống nhất (UFM) của NVIDIA để cung cấp không cần cấu hình, giám sát sức khỏe và chuyển đổi dự phòng tự động.

thông số kỹ thuật 920-9B210-00FN-0D0 cũng nêu bật các bộ nguồn dự phòng kép, mô-đun quạt có thể thay nóng và hỗ trợ các cấu hình trình quản lý mạng con dự phòng, đảm bảo tính khả dụng 99,999% cho các khối lượng công việc quan trọng.

4. Khuyến nghị Triển khai & Khả năng mở rộng

Đối với các tổ chức có kế hoạch áp dụng giải pháp OPN switch InfiniBand 920-9B210-00FN-0D0, các hướng dẫn triển khai sau đây được khuyến nghị:

  • Chiến lược cáp: Sử dụng cáp DAC OSFP-to-OSFP cho kết nối trong giá đỡ (lên đến 3m) và cáp AOC hoặc bộ thu phát quang cho liên kết giữa các giá đỡ và liên kết xương sống-lá (lên đến 100m). Xác minh rằng tất cả các cáp tương thích với 920-9B210-00FN-0D0 theo ma trận tương thích của NVIDIA để tránh các vấn đề về tính toàn vẹn tín hiệu.
  • Dự phòng: Triển khai bộ nguồn kép được kết nối với các PDU riêng biệt. Sử dụng ít nhất hai switch xương sống mỗi lá để loại bỏ các điểm lỗi đơn lẻ. Đối với các khối lượng công việc quan trọng, hãy xem xét dự phòng N+1 ở tầng xương sống.
  • Quản lý firmware: Đảm bảo tất cả các switch chạy các phiên bản firmware NVIDIA giống hệt nhau. Sử dụng tính năng nâng cấp firmware tự động của UFM để cập nhật theo giai đoạn mà không bị gián đoạn. Xác thực tính tương thích firmware với bộ điều hợp máy chủ và cáp trước khi triển khai.
  • Lộ trình mở rộng: Đối với các cụm vượt quá 4.096 nút, chuyển sang cấu trúc Clos gấp ba tầng hoặc tận dụng dragonfly+ với định tuyến thích ứng. 920-9B210-00FN-0D0 hỗ trợ lên đến 64 switch trong một mạng lưới duy nhất, với nhiều mạng lưới được kết nối thông qua các cổng kết nối cho các triển khai lớn hơn.
  • Xác thực hiệu suất: Trước khi triển khai sản xuất, hãy chạy các bài kiểm tra căng thẳng toàn diện bằng các công cụ như điểm chuẩn hiệu suất OpenFabrics Enterprise Distribution (OFED) để xác thực hiệu suất mạng lưới so với datasheet 920-9B210-00FN-0D0.

Khi tính toán tổng chi phí sở hữu, hãy tính đến số lượng tầng switch giảm và cáp đơn giản hóa so với các giải pháp thay thế có radix thấp hơn. Mặc dù giá 920-9B210-00FN-0D0 trên mỗi đơn vị cao hơn các switch HDR, chi phí trên mỗi cổng và chi phí mạng trên mỗi GPU thấp hơn đáng kể trong các triển khai quy mô lớn, làm cho nó trở thành một lựa chọn hiệu quả về chi phí cho các dự án exascale.

5. Vận hành, Giám sát & Khắc phục sự cố

Việc quản lý hiệu quả mạng lưới NDR đòi hỏi một khuôn khổ giám sát và khắc phục sự cố toàn diện. UFM của NVIDIA cung cấp một bảng điều khiển duy nhất cho toàn bộ mạng lưới dựa trên NVIDIA Mellanox 920-9B210-00FN-0D0, cung cấp:

  • Trực quan hóa cấu trúc liên kết: Tự động phát hiện và biểu diễn đồ họa của tất cả các switch, liên kết và điểm cuối, với các cập nhật trạng thái thời gian thực.
  • Bảng điều khiển hiệu suất: Chế độ xem thời gian thực về mức sử dụng cổng, tỷ lệ lỗi, chỉ báo tắc nghẽn và dung lượng bộ đệm trên toàn bộ mạng lưới.
  • Cảnh báo chủ động: Báo động dựa trên ngưỡng cho suy giảm liên kết, bất thường nhiệt độ, lỗi bộ nguồn và hao mòn cáp.
  • Cô lập lỗi: Quy trình khắc phục sự cố có hướng dẫn xác định cáp, bộ thu phát hoặc cổng switch bị lỗi, giảm thời gian trung bình để giải quyết (MTTR).
  • Phân tích lịch sử: Phân tích xu hướng và lập kế hoạch dung lượng dựa trên dữ liệu hiệu suất lịch sử, cho phép đưa ra quyết định mở rộng chủ động.

Để khắc phục sự cố nâng cao, hãy tận dụng các công cụ chẩn đoán tích hợp của switch, bao gồm các bài kiểm tra loopback, phân tích BER (tỷ lệ lỗi bit) và giám sát chẩn đoán mô-đun quang (DOM). Các sự cố phổ biến gặp phải trong các triển khai NDR ban đầu bao gồm định tuyến không tối ưu do tốc độ liên kết không bằng nhau, loại cáp không khớp hoặc không nhất quán firmware. Kích hoạt định tuyến thích ứng, xác minh rằng tất cả các liên kết đang hoạt động ở 400Gb/s với FEC được bật và đảm bảo firmware nhất quán trên tất cả các switch sẽ giải quyết phần lớn các bất thường về hiệu suất.

Các kỹ sư mạng cũng nên thiết lập một đường cơ sở của thông số kỹ thuật 920-9B210-00FN-0D0 trong giai đoạn xác thực, bao gồm độ trễ, thông lượng và tỷ lệ lỗi dự kiến. Độ lệch khỏi đường cơ sở này có thể được sử dụng làm chỉ báo sớm về các sự cố tiềm ẩn. OPN switch InfiniBand 920-9B210-00FN-0D0 cũng hỗ trợ ghi nhật ký sự kiện toàn diện qua syslog và SNMP, cho phép tích hợp với các ngăn xếp giám sát trung tâm dữ liệu hiện có.

6. Tóm tắt & Đánh giá Giá trị

920-9B210-00FN-0D0 mang lại một đề xuất giá trị hấp dẫn cho các tổ chức xây dựng hoặc mở rộng các cụm HPC và AI dựa trên NDR. Nó cung cấp 64 cổng 400Gb/s NDR với độ trễ dưới 100ns, tải SHARPv3, khả năng quản lý cấp doanh nghiệp và khả năng tương thích hoàn toàn với hệ sinh thái HDR hiện có — tất cả trong một nền tảng 1U nhỏ gọn. Các điểm giá trị chính bao gồm:

  • Hiệu suất: Giảm tới 75% độ trễ giao tiếp all-to-all và giảm tới 40% độ trễ all-reduce thông qua tải SHARPv3 và băng thông NDR.
  • Hiệu quả chi phí: Chi phí mạng trên mỗi GPU thấp hơn so với các giải pháp thay thế HDR trong các triển khai quy mô lớn, được thúc đẩy bởi radix cao hơn và số lượng tầng switch giảm.
  • Đơn giản hóa vận hành: Tích hợp sâu với UFM để quản lý thống nhất, cung cấp tự động, giám sát chủ động và khắc phục sự cố nhanh chóng.
  • Bảo vệ đầu tư: Tương thích hoàn toàn với cáp, quang học và ngăn xếp phần mềm HDR hiện có, cho phép nâng cấp theo giai đoạn mà không làm gián đoạn khối lượng công việc sản xuất.
  • Khả năng mở rộng trong tương lai: Hỗ trợ các cấu trúc Clos gấp ba tầng và dragonfly+, đảm bảo mạng lưới có thể mở rộng lên đến hơn 8.000 nút khi nhu cầu tính toán tăng lên.

Đối với các tổ chức đánh giá 920-9B210-00FN-0D0 để bán thông qua các đối tác kênh của NVIDIA, chúng tôi khuyên bạn nên xem lại datasheet 920-9B210-00FN-0D0 chi tiết và tương tác với kiến trúc sư giải pháp được chứng nhận để xác thực thiết kế cho khối lượng công việc và yêu cầu quy mô cụ thể của bạn. NVIDIA Mellanox 920-9B210-00FN-0D0 đã sẵn sàng cho sản xuất ngày hôm nay, cung cấp nền tảng kết nối hiệu suất cao, có thể mở rộng cho thế hệ đổi mới AI và HPC tiếp theo.