Mellanox (NVIDIA Mellanox) MFS1S00-H005V AOC Thực hành ứng dụng cáp quang hoạt động

August 11, 2026

tin tức mới nhất của công ty về Mellanox (NVIDIA Mellanox) MFS1S00-H005V AOC Thực hành ứng dụng cáp quang hoạt động

Thực hành ứng dụng cáp quang chủ động Mellanox (NVIDIA Mellanox) MFS1S00-H005V | Kết nối tốc độ cao giữa các giá đỡ tầm ngắn và đơn giản hóa hệ thống cáp

Bối cảnh và Thách thức: Nút thắt cổ chai về cáp trong kết nối giữa các giá đỡ

Một trung tâm siêu máy tính quốc gia đã gặp phải một nút thắt cổ chai bất ngờ sau khi nâng cấp mạng InfiniBand HDR 200G của mình — kết nối vật lý giữa các giá đỡ. Cơ sở này có 48 giá đỡ tính toán, mỗi giá đỡ chứa 16 máy chủ GPU, với mỗi máy chủ yêu cầu hai đường uplink 200G lên bộ chuyển mạch đỉnh giá đỡ (ToR) Leaf. Theo phương pháp truyền thống, kết nối giữa các giá đỡ dựa vào dây vá sợi quang cộng với các mô-đun quang riêng biệt: bộ thu phát QSFP56 SR4 được triển khai ở đỉnh mỗi giá đỡ, được kết nối qua dây nhảy sợi quang MPO với các bộ chuyển mạch Leaf ở các giá đỡ liền kề. Giải pháp này đã bộc lộ nhiều vấn đề trong quá trình triển khai ban đầu. Thứ nhất, sự lan tràn cáp rất nghiêm trọng — hơn 300 kết nối sợi quang đã được yêu cầu giữa 48 giá đỡ, và các khay cáp đã đạt đến công suất tối đa trong vòng hai tuần, khiến bất kỳ bổ sung mới nào cũng phụ thuộc vào việc loại bỏ các cáp hiện có. Thứ hai, tỷ lệ lỗi của các mô-đun quang cao đáng kể, với đội vận hành ghi nhận trung bình 3 đến 4 lần thay thế mô-đun mỗi tuần trong ba tháng đầu sau khi triển khai, thường yêu cầu đánh giá lại liên kết và gây ra sự chậm trễ xếp lịch công việc theo chuỗi. Thứ ba, mỗi dây nhảy MPO yêu cầu quản lý cực tính và làm sạch tỉ mỉ, thêm 15 đến 20 phút cho mỗi liên kết trong quá trình khởi động ban đầu. Trưởng bộ phận vận hành tóm tắt thách thức: "Chúng tôi cần một giải pháp có thể cung cấp hiệu suất 200G tương tự nhưng với ít thành phần hơn, xử lý đơn giản hơn và tỷ lệ lỗi thực địa giảm đáng kể."

Giải pháp và Triển khai: Giới thiệu cáp quang chủ động MFS1S00-H005V

Để giải quyết những điểm khó khăn này, trung tâm đã đánh giá nhiều phương án thay thế và cuối cùng đã chọn MFS1S00-H005V từ Mellanox (NVIDIA Mellanox) — một cáp AOC QSFP56 200G MFS1S00-H005V tích hợp bộ thu phát quang và sợi quang vào một cụm lắp ráp duy nhất, được kết nối sẵn. Là một cáp quang chủ động InfiniBand HDR 200Gb/s MFS1S00-H005V, nó loại bỏ nhu cầu về các mô-đun và dây nhảy riêng biệt, cung cấp kết nối cắm và chạy có thể kéo dài tới 50 mét — lý tưởng cho khoảng cách 5 đến 15 mét điển hình giữa các giá đỡ trong cơ sở này.

Chiến lược triển khai được thực hiện theo từng giai đoạn trong ba cuối tuần. Trong Giai đoạn 1, nhóm đã thay thế tất cả các kết nối Leaf-to-Leaf trong lớp spine lõi bằng NVIDIA Mellanox MFS1S00-H005V, xác nhận rằng danh sách tương thích MFS1S00-H005V bao gồm các bộ chuyển mạch Quantum hiện có của họ. Giai đoạn 2 mở rộng việc triển khai AOC lên các đường uplink đỉnh giá đỡ, kết nối mỗi nút tính toán với các bộ chuyển mạch Leaf. Giai đoạn 3 tập trung vào mạng GPU-tới lưu trữ, nơi giải pháp cáp AOC QSFP56 200G MFS1S00-H005V cung cấp độ trễ xác định cho lưu lượng hệ thống tệp song song. Nhóm đã dựa vào tờ dữ liệu MFS1S00-H005V để xác minh ngân sách liên kết và đảm bảo phạm vi 50 mét là đủ cho đường chạy dài nhất của họ (đo được 37 mét bao gồm các vòng dịch vụ).

Một lợi thế chính của phương pháp AOC là loại bỏ bước làm sạch bộ thu phát riêng biệt — mỗi MFS1S00-H005V được kiểm tra tại nhà máy và niêm phong, chỉ yêu cầu kiểm tra trực quan các mặt đầu nối trước khi lắp đặt. Nhóm đã sử dụng các nắp cáp được mã hóa màu để phân biệt kết nối leaf-to-spine với kết nối leaf-to-compute, giúp đơn giản hóa tài liệu hơn nữa.

Kết quả và Lợi ích: Cải thiện rõ rệt về độ tin cậy và hiệu quả hoạt động

Các số liệu sau khi triển khai cho thấy những cải thiện đáng kể trên nhiều phương diện. Thông số kỹ thuật MFS1S00-H005V — bao gồm mức tiêu thụ điện năng điển hình dưới 1,5W mỗi đầu và BER dưới 1e-15 — đã được hiện thực hóa đầy đủ trong môi trường sản xuất, với trung tâm báo cáo không có lỗi công việc liên quan đến liên kết nào trong hai tháng sau khi chuyển đổi. Bảng sau đây tóm tắt những cải tiến chính:

Chỉ số Trước (Mô-đun + Vá) Sau (AOC MFS1S00-H005V)
Thành phần vật lý trên mỗi liên kết 3 (2 mô-đun + 1 dây nhảy) 1 (AOC tích hợp)
Lỗi liên quan đến mô-đun (trung bình hàng tuần) 3,5 0
Thời gian khởi động liên kết trung bình 18 phút 3 phút
Tỷ lệ sử dụng khay cáp 92% (quan trọng) 47% (lành mạnh)
Tiết kiệm OPEX cáp hàng năm ~55%

Đội vận hành cũng lưu ý rằng vỏ bọc linh hoạt và bán kính uốn cong tối thiểu 30mm của cáp MFS1S00-H005V cho phép định tuyến gọn gàng hơn nhiều bên trong các khay cáp, giảm nhu cầu sử dụng dây buộc cáp và cải thiện luồng không khí. Khi đánh giá tổng chi phí, trung tâm nhận thấy rằng mặc dù giá MFS1S00-H005V trên mỗi đơn vị cao hơn một chút so với sự kết hợp mô-đun cộng với dây nhảy riêng lẻ trên cơ sở mỗi liên kết, việc loại bỏ hàng tồn kho dự phòng, giảm nhân công khắc phục sự cố và tỷ lệ lỗi gần như bằng không đã làm cho tổng chi phí sở hữu (TCO) thuận lợi hơn. MFS1S00-H005V để bán thông qua kênh của NVIDIA cũng đảm bảo thay thế nhanh chóng bất kỳ đơn vị bị lỗi nào (mặc dù không có đơn vị nào xảy ra trong ba tháng đầu).

Tóm tắt và Triển vọng: Một bản thiết kế cho các mạng HDR đơn giản hóa

Việc trung tâm siêu máy tính áp dụng thành công MFS1S00-H005V chứng minh cách cáp quang chủ động có thể đơn giản hóa đáng kể kết nối giữa các giá đỡ trong môi trường HDR 200G. Bằng cách hợp nhất bộ thu phát và sợi quang vào một cụm lắp ráp duy nhất, được chứng nhận trước, phương pháp AOC giảm số lượng thành phần, loại bỏ các lỗi thực địa liên quan đến mô-đun và giảm thời gian triển khai hơn 80%. Đối với các kiến trúc sư mạng và quản lý CNTT đang đối mặt với những thách thức tương tự về mật độ cáp, NVIDIA Mellanox MFS1S00-H005V cung cấp một con đường đã được chứng minh để đạt được độ tin cậy cao hơn và chi phí vận hành thấp hơn. Thông tin chi tiết kỹ thuật đầy đủ, bao gồm tờ dữ liệu MFS1S00-H005V và ma trận tương thích đã được xác minh, có sẵn thông qua các kênh chính thức. Trung tâm hiện có kế hoạch mở rộng chiến lược AOC sang khu vực mở rộng GPU mới của mình, dự kiến sẽ tái tạo những lợi ích tương tự ở quy mô lớn hơn nữa.