Theo The Information, Google đang phát triển một chip máy chủ AI mới mang tên Frozen v2, được thiết kế riêng cho mô hình Gemini nhằm giảm tình trạng thiếu tài nguyên tính toán AI. Chip này sớm nhất có thể được triển khai từ năm 2028.
Dẫn lời hai nguồn tin am hiểu nội bộ, The Information cho biết Frozen v2 là dự án tích hợp trực tiếp thiết kế của mô hình Gemini vào phần cứng. Trong nội bộ Google, đây được xem là một hướng đi để xử lý bài toán thiếu năng lực tính toán AI mà công ty đang đối mặt.
Nguồn tin này cho hay tình trạng thiếu tài nguyên tính toán AI đã gây áp lực trong nội bộ Google, thậm chí khiến Google Cloud phải từ chối một số hợp đồng với khách hàng.
Các nhân sự tham gia dự án ước tính Frozen v2 có thể đạt hiệu suất cao hơn TPU mới nhất 6-10 lần, xét theo số token xử lý trên mỗi đơn vị điện năng tiêu thụ.
Tên gọi “Frozen” xuất phát từ ý tưởng cố định vĩnh viễn một phần mô hình lên silicon. Google được cho là đặt mục tiêu triển khai dòng chip này sớm nhất vào năm 2028.
Dự án Frozen không nhằm thay thế TPU. Cũng như GPU của Nvidia, TPU được thiết kế để phục vụ nhiều mô hình AI khác nhau. Khi mô hình thay đổi, chip phải tối ưu lại cách xử lý, làm tăng thời gian xử lý.
Ngược lại, Frozen v2 tích hợp sẵn trên chip phần lớn logic xử lý dành cho Gemini, từ đó cắt giảm số bước tính toán và lượng dữ liệu cần di chuyển.
Theo The Information, chip Frozen có thể giúp tăng tốc độ phản hồi truy vấn, đồng thời tạo nền tảng để Google ra mắt thêm các dịch vụ ứng dụng AI mới.
Tuy nhiên, Frozen được thiết kế trên giả định Google sẽ tiếp tục duy trì kiến trúc hiện tại của Gemini. Về lâu dài, chip này chỉ tiếp tục phát huy hiệu quả nếu các phiên bản Gemini sau vẫn dựa trên kiến trúc tương tự.
Hiện Google vẫn chưa quyết định sẽ đưa bao nhiêu phần trọng số của mô hình lên chip. Trước đó, công ty từng cân nhắc một thiết kế Frozen ban đầu theo hướng ghi trực tiếp trọng số mô hình lên chip, nhưng đã tạm gác vì lo ngại làm giảm tuổi thọ chip. Thiết kế ban đầu này do nhà khoa học trưởng của Google DeepMind, Jeff Dean, dẫn dắt.