NVIDIA Mellanox 920-9B210-00FN-0D0 trong thực tế: Xây dựng một NDR Low-Latency Fabric cho mô hình MoE tỷ tham số

August 27, 2026

tin tức mới nhất của công ty về NVIDIA Mellanox 920-9B210-00FN-0D0 trong thực tế: Xây dựng một NDR Low-Latency Fabric cho mô hình MoE tỷ tham số

NVIDIA Mellanox 920-9B210-00FN-0D0 trong thực tế: Xây dựng mạng NDR độ trễ thấp cho các mô hình MoE hàng nghìn tỷ tham số

Bối cảnh & Thách thức: Khi giao tiếp All-to-All trở thành nút thắt cổ chai trong huấn luyện

Một tổ chức nghiên cứu AI hàng đầu gần đây đã mở rộng cụm huấn luyện mô hình ngôn ngữ lớn của mình từ 1.024 lên 4.096 GPU NVIDIA H100, với mục tiêu đầy tham vọng là giảm thời gian huấn luyện cho một mô hình MoE (Mixture of Experts) thưa thớt với 1,8 nghìn tỷ tham số từ vài tháng xuống dưới hai tuần. Tuy nhiên, trong quá trình xác thực ban đầu, nhóm đã phát hiện ra rằng mạng HDR 200Gb/s hiện tại của họ đang gặp phải tình trạng tắc nghẽn nghiêm trọng trong giai đoạn giao tiếp all-to-all — một đặc điểm điển hình của kiến trúc MoE — khiến việc sử dụng GPU giảm mạnh từ mức dự kiến 85% xuống chỉ còn 52%, thấp hơn nhiều so với ngưỡng cần thiết để đáp ứng thời hạn huấn luyện của họ.

Phân tích mạng cho thấy giao tiếp tập thể all-to-all chiếm hơn 40% dấu chân giao tiếp của mô hình MoE, và khi số lượng chuyên gia tăng lên, mô hình lưu lượng truy cập ngày càng trở nên phân mảnh và bùng nổ. Mạng HDR hiện tại, sau khi kích hoạt các cơ chế kiểm soát tắc nghẽn, đã trải qua sự gia tăng độ trễ đuôi đáng kể, khiến một phần lớn GPU bị treo và chờ đợi. Tổ chức này khẩn cấp cần một mạng có khả năng cung cấp độ trễ dưới micro giây xác định, truyền tải không mất mát và khả năng mở rộng phi chặn khổng lồ — và NVIDIA Mellanox 920-9B210-00FN-0D0 được thiết kế riêng cho thách thức này.

Giải pháp & Triển khai: Kiến trúc Leaf-Spine được tối ưu hóa cho MoE với NDR

Tổ chức đã triển khai một mạng leaf-spine hai tầng được xây dựng xung quanh 920-9B210-00FN-0D0 InfiniBand switch OPN. Trong mỗi rack tính toán, hai 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR switch đã được triển khai ở lớp leaf, cung cấp kết nối 400Gb/s cho 64 máy chủ H100 cổng kép thông qua cáp quang chủ động OSFP-to-OSFP. Ở lớp spine, 16 switch 920-9B210-00FN-0D0 bổ sung đã kết nối tất cả các switch leaf, tạo ra một mạng fat-tree hoàn toàn phi chặn với băng thông phân chia tổng cộng 51,2 Tb/s.

Trung tâm của giải pháp này là công nghệ SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) tích hợp của switch. Đối với khối lượng công việc MoE, giao tiếp all-to-all đã được chuyển trực tiếp lên mạng switch, với các switch thực hiện giảm và phân phối lại dữ liệu trong mạng. Điều này loại bỏ nhu cầu về nhiều lượt xử lý phía máy chủ, giảm đáng kể chi phí giao tiếp đã làm ảnh hưởng đến việc triển khai HDR trước đó. 920-9B210-00FN-0D0 datasheet nhấn mạnh độ trễ cắt ngang dưới 100ns, đã được xác nhận trong giai đoạn chứng minh khái niệm và chứng tỏ là yếu tố quan trọng đối với các yêu cầu độ trễ nghiêm ngặt của khối lượng công việc MoE.

920-9B210-00FN-0D0 specifications — bao gồm nguồn điện dự phòng kép và quạt có thể thay nóng — đã mang lại sự tự tin cho nhóm trong việc đạt được mục tiêu khả dụng 99,999%. Nhóm kỹ thuật cũng xác nhận rằng hệ sinh thái 920-9B210-00FN-0D0 compatible bao gồm tất cả các quang và cáp OSFP mà họ đã đủ điều kiện, loại bỏ sự chậm trễ trong mua sắm và đơn giản hóa lịch trình triển khai.

Kết quả & Lợi ích đo lường được: Từ nút thắt cổ chai đến yếu tố thúc đẩy

Sau khi mạng NDR được triển khai đầy đủ và công việc huấn luyện MoE được khởi động lại, tổ chức đã đo lường được những cải tiến mang tính chuyển đổi trên nhiều khía cạnh:

  • Phục hồi sử dụng GPU: Mức sử dụng GPU trung bình tăng từ 52% lên 89%, với mức sử dụng đỉnh đạt 94% trong các giai đoạn chuyên sâu về tính toán — một kết quả trực tiếp của việc loại bỏ các tình trạng treo do mạng gây ra.
  • Giảm độ trễ all-to-all: Thời gian cần thiết cho một lần trao đổi all-to-all đầy đủ trên 4.096 GPU giảm từ 180ms xuống dưới 45ms, cải thiện 75% trực tiếp chuyển thành các vòng lặp huấn luyện nhanh hơn.
  • Thời gian hoàn thành công việc: Lịch trình huấn luyện dự kiến cho mô hình MoE 1,8T đã giảm từ 14 ngày xuống chỉ còn 9 ngày — tăng tốc 36% giúp cắt giảm đáng kể cả thời gian đưa ra thị trường và chi phí tính toán đám mây.
  • Hiệu quả hoạt động: Với 64 cổng mỗi switch, số lượng switch spine cần thiết đã giảm 37% so với thiết kế HDR 40 cổng, đơn giản hóa việc đi dây và giảm tiêu thụ điện năng trên mỗi rack xuống 28%.

Từ góc độ tổng chi phí sở hữu, đội ngũ tài chính của tổ chức lưu ý rằng mặc dù 920-9B210-00FN-0D0 price trên mỗi đơn vị cao hơn các giải pháp thay thế HDR, chi phí mạng trên mỗi GPU thực tế đã giảm do hệ số radix cao hơn và số lượng lớp switch giảm. Lợi thế kinh tế này, kết hợp với những cải thiện hiệu suất đáng kể, đã làm cho việc nâng cấp NDR trở thành một chiến thắng kinh doanh rõ ràng. 920-9B210-00FN-0D0 InfiniBand switch OPN solution cũng tích hợp liền mạch với việc triển khai NVIDIA UFM hiện có của họ, cung cấp khả năng hiển thị tập trung và cảnh báo tự động giúp giảm chi phí vận hành xuống 40%.

Tóm tắt & Triển vọng: Nền tảng NDR cho khối lượng công việc MoE thế hệ tiếp theo

NVIDIA Mellanox 920-9B210-00FN-0D0 đã chứng tỏ là giải pháp mang tính chuyển đổi mà tổ chức nghiên cứu AI này cần để phát huy hết tiềm năng của cụm H100 4.096 GPU của mình. Bằng cách cung cấp băng thông NDR 400Gb/s, mật độ 64 cổng và tính toán trong mạng SHARPv3, switch đã cho phép họ mở rộng từ 1.024 lên 4.096 GPU mà không ảnh hưởng đến hiệu suất hoặc khả năng quản lý — một thành tích mà sẽ không thể thực hiện được với cơ sở hạ tầng HDR trước đây của họ.

Nhìn về phía trước, tổ chức có kế hoạch mở rộng lên 8.192 GPU trong vòng 18 tháng tới, tận dụng 920-9B210-00FN-0D0 for sale thông qua các đối tác kênh của NVIDIA để xây dựng một mạng lưới gấp ba lần Clos lớn hơn nữa. Đối với các tổ chức đang đánh giá các khoản đầu tư mạng AI và HPC thế hệ tiếp theo của họ, 920-9B210-00FN-0D0 cung cấp một giải pháp đã được chứng minh, sẵn sàng cho sản xuất, đáp ứng lời hứa về tối ưu hóa kết nối RDMA độ trễ thấp ở quy mô exascale.