Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Thực hành chuyển đổi InfiniBand
July 15, 2026
Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch trong thực tế.
Bối cảnh và thách thức: Khi quy mô cụm gặp khó khăn liên kết
Bộ phận nghiên cứu AI của một công ty Internet hàng đầu đã thấy mình ở một ngã tư quen thuộc.Hạm đội máy chủ GPU ngày càng tăng của họ, trải dài trên nhiều giá đỡ và ngày càng được sử dụng để đào tạo mô hình ngôn ngữ lớn, bị thời gian hoàn thành công việc không thể đoán trướcCác mô hình dựa trên Ethernet hiện tại, trong khi phù hợp với khối lượng công việc chung, không thể xử lý các mô hình giao thông đồng bộ, bùng nổ của đào tạo phân tán.Tất cả các hoạt động giảm sẽ thường xuyên bị đình trệ do các gói rơi và tắc nghẽn incast, đẩy chu kỳ đào tạo từ ngày đến tuần. Đội ngũ cơ sở hạ tầng cần một sự thay đổi cơ bản trong cách mạng hậu端 của họ xử lý lưu lượng RDMA,và họ cần nó mà không cần sửa đổi toàn bộ kiến trúc trung tâm dữ liệu của họ.
Thiết kế giải pháp: triển khai 920-9B210-00FN-0D0 InfiniBand Switch OPN
Sau khi đánh giá nhiều lựa chọn kết nối, nhóm đã chọnMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0như là nền tảng của cấu trúc backend mới của họ. việc triển khai tập trung vào một topology hai tầng lá-lưng, với mỗi chuyển đổi lá kết nối lên đến 40 nút GPU thông qua các liên kết 400Gb / s.920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRPhiên bản này được chọn đặc biệt cho kiến trúc không chặn và khả năng tính toán trong mạng SHARPv3 tích hợp.Điều này cho phép nhóm để chuyển tải các hoạt động truyền thông tập thể trực tiếp vào vải chuyển đổi, giảm chi phí CPU và giải phóng các chu kỳ GPU cho tính toán thực tế.
Về mặt triển khai vật lý, các công tắc được cài đặt với luồng không khí từ phía trước sang phía sau để phù hợp với cấu hình lối đi nóng / lối đi lạnh hiện có.Bảng dữ liệu 920-9B210-00FN-0D0để xác minh các yêu cầu về năng lượng và làm mát, đảm bảo tích hợp liền mạch vào các đơn vị phân phối điện hiện có của họ.920-9B210-00FN-0D0 tương thíchquang học được xác nhận trên toàn bộ ngân sách liên kết, bao gồm các kết nối cột sống đến lá trải dài đến 100 mét.
Phương pháp triển khai: tích hợp từng bước
- Giai đoạn 1: Xác thực trong phòng thí nghiệm:Một thử nghiệm quy mô nhỏ với 8 nút GPU và hai chuyển đổi đã được sử dụng để so sánh độ trễ và thông lượng.NVIDIA Mellanox 920-9B210-00FN-0D0chứng minh độ trễ chuyển đổi dưới 600ns, cải thiện 60% so với thế hệ HDR trước đó.
- Giai đoạn 2 Việc triển khai theo giai đoạn:Nhóm đã di chuyển một pods đào tạo tại một thời điểm, sử dụng Unified Fabric Manager của NVIDIA để theo dõi các số liệu về sức khỏe và tắc nghẽn liên kết trong thời gian thực.Điều này làm giảm thiểu sự gián đoạn cho khối lượng công việc sản xuất đang diễn ra.
- Giai đoạn 3 Tích hợp toàn diện:Tất cả 18 công tắc đã được triển khai trên ba giá đỡ, tạo thành một cột sống hoàn toàn không chặn với các liên kết lên 400Gb / s.Đường dẫn thích nghi đã được kích hoạt để cân bằng lưu lượng truy cập một cách năng động và tránh quá nhiều thuê bao trong thời gian giới thiệu công việc cao điểm.
Trong suốt quá trình triển khai, nhóm kỹ sư đã đề cập đến920-9B210-00FN-0D0 thông số kỹ thuậtđể tinh chỉnh các cài đặt bộ đệm và các thông số kiểm soát tắc nghẽn.cho phép bảo trì chủ động và lập kế hoạch năng lực.
Kết quả có thể đo lường và lợi ích hoạt động
Trong vòng hai tuần sau khi triển khai toàn diện, những cải tiến đã được thể hiện. thời gian hoàn thành tất cả giảm cho một công việc đào tạo chuẩn 1.024 GPU giảm từ 12,3 giây xuống 7,8 giây,đại diện cho một sự giảm 37% chi phí liên lạcThời gian hoàn thành công việc cho một mô hình kiểu GPT điển hình được cải thiện gần 30%, cho phép nhóm nghiên cứu lặp lại nhanh hơn và chạy nhiều thí nghiệm hơn mỗi tuần.Động cơ SHARPv3 tích hợp đã giảm trung bình 18% hoạt động tập thể, trực tiếp chuyển thành việc sử dụng GPU cao hơn và tiêu thụ năng lượng thấp hơn mỗi lần chạy đào tạo.
Về mặt hoạt động, nhóm CNTT báo cáo ít thất bại liên quan đến mạng và ít thời gian hơn đáng kể để chẩn đoán các vấn đề ở cấp liên kết.920-9B210-00FN-0D0 Giải pháp OPN chuyển đổi InfiniBandchứng minh được sự ổn định đáng kể, không có sự gián đoạn không được lên kế hoạch trong thời gian quan sát ba tháng.người có thể quản lý toàn bộ vải thông qua một tấm kính duy nhất.
Các cân nhắc về chi phí và mua sắm
Trong khi ban đầuGiá 920-9B210-00FN-0D0bằng cách giảm thời gian hoàn thành công việc và cải thiện việc sử dụng GPU,tổ chức đạt được giảm 22% chi phí thực tế đám mây cho dung lượng tính toán tương đươngHơn nữa,920-9B210-00FN-0D0 để bánthông qua nhiều đối tác kênh cho phép đấu thầu cạnh tranh, và cam kết hỗ trợ dài hạn từ NVIDIA Mellanox đã mang lại sự tự tin cho đầu tư.
Tóm lại & triển vọng: Một kế hoạch cho cơ sở hạ tầng AI thế hệ tiếp theo
Việc triển khaiMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0tại cơ sở nghiên cứu AI quy mô lớn này phục vụ như một kiến trúc tham chiếu hấp dẫn cho các tổ chức phải đối mặt với những thách thức tương tự về kết nối.độ trễ dưới microsecondCác kiến trúc sư mạng sẽ đánh giá cao tính linh hoạt của các công nghệ này.920-9B210-00FN-0D0 InfiniBand switch OPNtrong các topology khác nhau, trong khi các nhà quản lý CNTT có thể dựa vào các công cụ quản lý mạnh mẽ vàBảng dữ liệu 920-9B210-00FN-0D0cho kế hoạch năng lực.
Nhìn về phía trước, tổ chức đã lên kế hoạch mở rộng mô hình để hỗ trợ các cụm GPU lớn hơn,bao gồm tích hợp các DPU BlueField-3 để giảm tải lưu trữ bổ sung và cô lập bảo mật.920-9B210-00FN-0D0 tương thíchHệ sinh thái đảm bảo rằng các nâng cấp trong tương lai, cho dù là NIC mới hơn hoặc công nghệ quang học, sẽ được hỗ trợ liền mạch.Chuyển đổi này không chỉ đại diện cho một nâng cấp từng bước mà còn là một khả năng cơ bản cho hiệu suất ở quy mô.

