Cuộc cạnh tranh giành vị trí dẫn đầu AI giữa Mỹ và Trung Quốc đang bước sang giai đoạn mới, khi các công ty công nghệ hàng đầu bắt đầu dùng chính AI để phát triển các mô hình mạnh hơn. Đích đến của cuộc đua này là tự cải thiện đệ quy, hay RSI, nhưng cùng lúc cũng làm gia tăng lo ngại về an toàn và nguy cơ AI vượt ngoài tầm kiểm soát.
Theo South China Morning Post ngày 13/9, các công ty AI lớn tại Mỹ và Trung Quốc hiện tập trung khai thác những mô hình tiên tiến để viết mã, thiết kế thí nghiệm và xây dựng kỹ thuật huấn luyện mới nhằm nâng hiệu năng cho thế hệ kế tiếp.
RSI được xem là mục tiêu dài hạn của ngành AI. Theo đó, một mô hình có thể tạo ra phiên bản kế nhiệm tốt hơn, rồi chính phiên bản mới tiếp tục cải thiện thế hệ sau. Nếu thành hiện thực, cơ chế này có thể tạo ra vòng phản hồi giúp tốc độ phát triển AI tăng mạnh.
Tuần trước, OpenAI cho biết trên blog rằng họ đang hướng tới việc xây dựng một “nhà nghiên cứu AI” có khả năng tự động hóa hoạt động nghiên cứu deep learning. Tuy nhiên, công ty cũng thừa nhận vẫn chưa chắc đâu là cách tiếp cận an toàn để đạt RSI hoàn chỉnh mà vẫn bảo đảm căn chỉnh. OpenAI đồng thời giới thiệu GPT-6 Astra, mẫu mô hình ra mắt đầu tháng 9, là “mô hình thông minh và được căn chỉnh tốt nhất thế giới”.
Giới phân tích hiện cho rằng Mỹ đang nhỉnh hơn Trung Quốc trong mảng nghiên cứu tự động dựa trên AI, một yếu tố quan trọng để tiến tới RSI. Trong một đánh giá hồi tháng 6, Wei Sun, nhà phân tích trưởng về AI tại Counterpoint Research, dẫn nghiên cứu của Anthropic cho thấy mô hình Claude có thể tham gia thiết kế thí nghiệm, viết mã và đề xuất kỹ thuật huấn luyện mới cho các mô hình lớn hơn.
Google DeepMind cũng đang đi theo hướng tương tự. Ngày 2/9, đơn vị này công bố Gemini 3.8 Flash và cho biết mô hình được thiết kế để xử lý công việc kỹ thuật phần mềm, các tác vụ theo kiểu agent và suy luận đa bước phức tạp. Trên X, nhà nghiên cứu Yao Shunyu của Google DeepMind mô tả đây là “bước nhảy lớn hướng tới tự cải thiện đệ quy”.
OpenAI cũng phát triển một hệ thống AI đóng vai trò như trợ lý nghiên cứu tự động. Theo giới thiệu của công ty, GPT-6 Astra có thể tự thực hiện một số thí nghiệm mà trước đây các nhà nghiên cứu giàu kinh nghiệm phải mất vài ngày mới hoàn thành. Dù được đánh giá đi trước, Mỹ và Trung Quốc đều chưa công khai chứng minh được AI có thể tự cải thiện hoàn toàn theo cách tự trị.
Erich Grunewald, nghiên cứu viên cao cấp tại New American National Security Institute, nhận định các công ty Mỹ hiện dẫn trước Trung Quốc vài tháng và sở hữu nhiều tài nguyên tính toán hơn để triển khai. Theo ông, giới nghiên cứu Trung Quốc rất giỏi tối ưu hiệu năng trong điều kiện phần cứng hạn chế, nhưng rào cản về năng lực tính toán vẫn còn hiện hữu.
Kyle Chan, nghiên cứu viên tại Viện Brookings, cho rằng AI có thể hỗ trợ tối ưu thiết kế chip hoặc thực thi mã, nhưng những đột phá nền tảng về kiến trúc mô hình vẫn đòi hỏi chuyên môn của con người.
Phía Trung Quốc cũng đang xây dựng lộ trình riêng để tiến tới AI tự cải thiện. Ngày 31/8, Tang Jie, nhà sáng lập Z.ai tại Bắc Kinh, cho biết trong cuộc họp công bố kết quả kinh doanh rằng mô hình thế hệ mới GLM-6 đang tiến theo hướng “tự tiến hóa”. Theo lộ trình công nghệ do Z.ai đưa ra, GLM-6.0 được định hướng tới khả năng “tự học hoàn toàn”, với mục tiêu để AI tự quản toàn bộ quá trình huấn luyện, từ tiền huấn luyện đến các giai đoạn huấn luyện tiếp theo.
Tang Jie cho biết AI cần có khả năng tự xác định thời điểm dừng học và tự sửa lỗi.
Một số tổ chức khác tại Trung Quốc cũng đặt mục tiêu tương tự. Nhóm nghiên cứu Minimax 2.7 hồi đầu năm cho biết mô hình của họ có thể cập nhật bộ nhớ và hình thành năng lực phức tạp trong quá trình thí nghiệm học tăng cường. Tháng trước, DeepSeek phát triển một cơ chế agent nhằm nâng mức độ tự trị, cho phép AI xử lý tác vụ nhiều bước, chạy mã và tương tác với phần mềm bên ngoài.
Dù vậy, một số chuyên gia cho rằng những năng lực này vẫn chưa đủ để khẳng định RSI đã thực sự thành hình. Philipp Schmid, kỹ sư cấp staff tại Google DeepMind, nhận định ngay cả các agent có mức tự trị cao hiện nay vẫn phải phụ thuộc vào con người để đánh giá liệu một thay đổi có thực sự là cải tiến hay không. Theo ông, để đạt RSI đúng nghĩa, AI không chỉ phải tự tìm ra thay đổi mà còn phải tự đánh giá được giá trị của thay đổi đó, trong khi bằng chứng công khai cho thấy điều này vẫn còn rất hạn chế.
Khi cuộc đua RSI tăng tốc, tranh cãi về an toàn AI cũng nóng lên. Ngày 9/9, Jacob Coxon, cựu nghiên cứu viên OpenAI, viết trên X rằng ông rời Anthropic trong bối cảnh lo ngại các hãng như OpenAI và Anthropic đang “lao thẳng tới siêu trí tuệ tự cải thiện” mà đặt cược bằng sự an toàn của con người. Ông thậm chí cho rằng khả năng AI có thể đe dọa sự tồn vong của nhân loại trong thập kỷ tới là trên 10%.
Jakub Pachocki, nhà khoa học trưởng của OpenAI, cũng đặt câu hỏi liệu việc thúc đẩy RSI với tốc độ cao trong ngắn hạn có thực sự là lựa chọn đúng đắn đối với cộng đồng nghiên cứu AI hay không.
Tại Trung Quốc, các cảnh báo tương tự cũng bắt đầu xuất hiện. Đầu tháng này, Wang Lihong, Phó cục trưởng Cục Điều phối An ninh mạng thuộc Cơ quan Quản lý Không gian mạng Quốc gia Trung Quốc, cảnh báo về “rủi ro cực đoan ngoài kiểm soát” sau một trường hợp mô hình AI tuyến đầu vượt qua sandbox để tấn công môi trường vận hành thực.
Các nhà nghiên cứu lo ngại rằng rủi ro sẽ còn lớn hơn nếu những mô hình có lỗi hoặc chưa được căn chỉnh đúng cách lại tham gia huấn luyện cho thế hệ AI kế tiếp. Trong kịch bản đó, vấn đề không chỉ là mối đe dọa với Mỹ hay Trung Quốc, mà có thể trở thành nguy cơ an ninh toàn cầu.
Tổng thể, trọng tâm của cuộc đua AI Mỹ - Trung hiện nằm ở việc bên nào có thể nâng năng lực nghiên cứu tự trị của AI lên trước và một cách ổn định. Dù Mỹ đang được đánh giá có ưu thế về tài nguyên tính toán và nghiên cứu nền tảng, Trung Quốc cũng bám đuổi sát với chiến lược “tự tiến hóa”. Tuy nhiên, cả hai bên vẫn chưa công khai chứng minh được một hệ thống RSI hoàn chỉnh, nơi AI có thể tự cải thiện hiệu năng một cách trọn vẹn.