Bên trong trung tâm dữ liệu AI FactoryX Seoul của NHN Cloud. Ảnh: NHN Cloud

NHN Cloud đã đưa trung tâm dữ liệu AI FactoryX Seoul, nơi lắp đặt 7.656 GPU Nvidia B200, vào vận hành và xem đây là nền tảng chủ lực để tăng sức cạnh tranh trên thị trường hạ tầng AI. Doanh nghiệp cho rằng lợi thế cốt lõi không chỉ nằm ở số lượng GPU, mà còn ở khả năng kết nối hàng nghìn GPU thành một cluster tính toán lớn, đồng thời duy trì vận hành ổn định bằng hệ thống làm mát bằng nước và hạ tầng mạng, bảo mật tách biệt.

Tại buổi tham quan trung tâm dữ liệu ngày 6/8 ở quận Yeongdeungpo, Seoul, ông Lee Il-jun, Trưởng bộ phận Kinh doanh Công nghệ của NHN Cloud, cho biết “lợi thế cạnh tranh lớn nhất là quy mô”. Theo ông, năng lực của nhà cung cấp hạ tầng AI không chỉ được quyết định bởi việc sở hữu hàng nghìn GPU, mà còn bởi khả năng ghép chúng thành cluster lớn phục vụ huấn luyện AI và bảo đảm vận hành ổn định.

FactoryX Seoul hiện lắp tổng cộng 7.656 GPU B200. Trong đó, tầng 3 và tầng 4, mỗi tầng bố trí 255 node, tương đương 510 node, kết nối thành một cluster gồm 4.080 GPU. NHN Cloud cho biết ban đầu công ty đề xuất chia thành hai cluster, nhưng sau đó hợp nhất thành một theo yêu cầu từ phía chính phủ về cấu hình cluster quy mô lớn.

Trong huấn luyện AI quy mô lớn, nhiều GPU cùng xử lý một tác vụ. Vì vậy, ngoài số lượng GPU, các yếu tố như mạng băng thông cao, lưu trữ và năng lực vận hành cluster cũng đóng vai trò quan trọng. Theo NHN Cloud, khi đo hiệu năng cụm 510 node bằng bài kiểm thử High Performance Linpack (HPL), hệ thống đứng thứ 20 trên bảng xếp hạng siêu máy tính toàn cầu TOP500.

Theo doanh nghiệp, quy mô lớn chỉ có thể phát huy hiệu quả khi đi kèm năng lực bảo đảm điện và làm mát. NHN Cloud nhận định rằng, khác với các dịch vụ yêu cầu độ trễ cực thấp, hạ tầng huấn luyện AI ưu tiên khả năng tập trung nguồn điện lớn và tài nguyên GPU tại một điểm hơn là vị trí vật lý của trung tâm dữ liệu.

Ông Lee giải thích đặc thù của tác vụ AI là truyền khối lượng dữ liệu lớn một lần rồi huấn luyện trong thời gian dài, nên chênh lệch về vị trí giữa khu vực thủ đô và địa phương không quá lớn. Vì thế, khi lựa chọn FactoryX Seoul, yếu tố quyết định không phải quỹ đất đặt trung tâm dữ liệu mà là khả năng bảo đảm nguồn điện quy mô lớn đúng thời điểm cần thiết.

Để phù hợp với môi trường GPU mật độ cao, NHN Cloud áp dụng công nghệ làm mát trực tiếp bằng nước (DLC). FactoryX Seoul ban đầu được thiết kế theo mô hình làm mát bằng gió, nhưng để triển khai B200 ở quy mô lớn, công ty đã mất khoảng 5 tháng để bổ sung hệ thống đường ống nước và thiết bị làm mát riêng. Theo đó, tấm làm mát tiếp xúc trực tiếp với chip CPU và GPU để tản nhiệt, trong khi bộ nhớ, thiết bị mạng và hệ thống lưu trữ vẫn được làm mát bằng gió.

NHN Cloud cho biết làm mát bằng nước không chỉ ảnh hưởng đến hiệu suất điện năng mà còn tác động trực tiếp đến độ ổn định vận hành. GPU có thể tự giảm hiệu năng khi nhiệt độ tăng, thậm chí dừng hoạt động nếu vượt ngưỡng nhất định. Do đó, quy mô cluster càng lớn, hiệu quả làm mát càng ảnh hưởng rõ đến hiệu năng tính toán thực tế.

Theo ông Lee, khó khăn lớn nhất trong vận hành là xử lý sự cố. “Khi xảy ra sự cố, tác vụ của khách hàng có thể bị gián đoạn, kéo theo khiếu nại hoặc trách nhiệm bồi thường”, ông nói. NHN Cloud cũng đánh giá môi trường làm mát bằng nước có nguy cơ phát sinh sự cố thiết bị thấp hơn so với làm mát bằng gió.

Bảo mật cũng là một yếu tố then chốt trong quá trình vận hành hạ tầng AI quốc gia quy mô lớn. NHN Cloud cho biết tài nguyên GPU được xây dựng bằng ngân sách nhà nước đang được vận hành trên một mạng tách biệt với hạ tầng đám mây hiện hữu, nhằm đáp ứng yêu cầu bảo mật theo từng nhóm người dùng như cơ quan nhà nước và khối công nghiệp, học thuật, nghiên cứu. Công ty cũng triển khai riêng tường lửa, thiết bị ứng phó DDoS và hệ thống ngăn chặn xâm nhập (IPS). Theo NHN Cloud, doanh nghiệp đã đạt nhiều chứng nhận bảo mật để năng lực bảo vệ dịch vụ đám mây được kiểm chứng từ bên ngoài.

Nguồn lực đã triển khai hiện cũng được đưa vào các chương trình AI quốc gia. Tính đến tháng trước, NHN Cloud đã cung cấp tài nguyên GPU quốc gia, gồm các cụm 510 node và 255 node, cho khoảng 200 tổ chức thuộc khối công nghiệp, viện nghiên cứu và trường đại học. Công ty hiện cũng đang chuyển đổi môi trường vận hành để phục vụ các doanh nghiệp tham gia dự án “mô hình nền tảng AI độc lập”.

FactoryX Seoul được xây dựng thông qua dự án hạ tầng tính toán AI của Bộ Khoa học và ICT Hàn Quốc cùng Cơ quan Xúc tiến Công nghiệp Thông tin và Truyền thông Hàn Quốc (NIPA). NHN Cloud phụ trách mua sắm và triển khai hạ tầng AI quy mô khoảng 1 nghìn tỷ won, đồng thời đảm nhiệm vận hành trong 5 năm tới. Theo cơ cấu dự án, một phần GPU thuộc sở hữu nhà nước có thể được NHN Cloud sử dụng cho hoạt động R&D nội bộ hoặc cung cấp dịch vụ cho khách hàng tư nhân.

Tuy nhiên, để biến đầu tư GPU quy mô lớn thành động lực mở rộng kinh doanh hạ tầng AI ở khu vực tư nhân, bài toán then chốt vẫn là bảo đảm nhu cầu dài hạn. GPU đòi hỏi chi phí đầu tư ban đầu lớn, trong khi chu kỳ ra mắt sản phẩm mới lại nhanh. Nếu tỷ lệ sử dụng giảm, gánh nặng tài chính đối với đơn vị vận hành có thể tăng mạnh.

Ông Lee cho rằng nếu chính phủ sớm đưa ra kế hoạch thuê một lượng tài nguyên nhất định, các doanh nghiệp đám mây sẽ thuận lợi hơn trong việc đầu tư. Theo ông, để mở rộng đầu tư GPU quy mô lớn, thị trường cần khả năng dự báo nhu cầu dài hạn.

Từ khóa

#NHN Cloud #FactoryX Seoul #Nvidia B200 #GPU #hạ tầng AI #trung tâm dữ liệu AI #TOP500 #HPL #làm mát bằng nước #DDoS #IPS
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.