Google đang vấp phải tranh cãi liên quan đến Nano Banana 2, khi ngày càng nhiều người dùng cho rằng mô hình tạo ảnh AI này cho kết quả kém hơn trước. Trong bài thử nghiệm mới, TechRadar cũng nhận định ChatGPT hiện nhỉnh hơn Gemini về chất lượng hình ảnh, dù tốc độ tạo ảnh của Gemini vẫn nhanh hơn.
Theo TechRadar, ngày 5/8 (giờ địa phương), trên Reddit gần đây xuất hiện nhiều bài đăng cho rằng Nano Banana 2 không còn giữ được chất lượng như thời điểm mới ra mắt. Một người dùng nhận xét phần lớn ảnh được tạo ra gần đây trông “nhạt nhòa”, và ngay cả khi viết prompt chi tiết hơn, kết quả cũng không cải thiện đáng kể.
Những phàn nàn này không phải mới xuất hiện. Từ tháng 5, Reddit đã có nhiều bài viết cho rằng chất lượng của Nano Banana 2 bị “thụt lùi” so với trước. Dù chưa thể xem đây là bằng chứng cho thấy mô hình suy giảm năng lực, các phản hồi này cho thấy một bộ phận người dùng đã cảm nhận rõ sự thay đổi theo thời gian.
Đầu tháng 7, Google từng giới thiệu mô hình mới mang tên Nano Banana 2 Lite. Sau đó, hãng tích hợp Nano Banana 2 vào Google Earth nhưng đã tạm dừng một tính năng liên quan sau khi phát sinh vấn đề lạm dụng. Tuy nhiên, hiện chưa có dấu hiệu nào cho thấy các động thái này trực tiếp làm thay đổi mô hình tạo ảnh hiện tại.
Một giả thuyết được đưa ra là phần mô hình văn bản dùng để diễn giải prompt đã thay đổi. Ngay cả khi mô hình tạo ảnh không đổi, cách hệ thống đọc và hiểu chỉ dẫn ở khâu xử lý trước vẫn có thể tạo ra khác biệt đáng kể trong kết quả đầu ra. Theo TechRadar, giả thuyết này phù hợp với nhận định rằng những thay đổi gần đây của Gemini chủ yếu nằm ở cách lựa chọn và phối hợp mô hình, thay vì ở bản thân mô hình tạo ảnh.
Để kiểm chứng cảm nhận cho rằng Nano Banana 2 “xuống chất”, TechRadar thực hiện so sánh qua ba bài thử. Ở bài thử đầu tiên, đề bài là góc nhìn ngước lên bầu trời với một con rồng bay phía trên. TechRadar đánh giá ảnh do ChatGPT tạo ra trông tự nhiên và thuyết phục hơn, gần với ảnh thật, trong khi kết quả từ Gemini vẫn mang rõ cảm giác là ảnh do AI tạo.
Bài thử thứ hai là cảnh một nam và một nữ ngoài 50 tuổi trò chuyện bên ly cà phê trong quán. Theo TechRadar, ảnh của Gemini để lộ sự gượng ở cách thể hiện nhân vật và hiệu ứng phản xạ; khuôn mặt cũng tạo cảm giác gần với hiệu ứng uncanny valley. Trong khi đó, ảnh từ ChatGPT có ít chi tiết hơn nhưng tổng thể tự nhiên hơn và bớt yếu tố bất thường.
Ở bài thử thứ ba, đề bài là bữa sáng kiểu Anh. Cả hai mô hình đều thể hiện khá tốt kết cấu món ăn và cách sắp xếp trên đĩa. Tuy nhiên, kết quả từ Gemini gặp lỗi ở phần chữ trên thực đơn khi tạo ra những ký tự không giống từ ngữ thực. Dù chênh lệch ở bài thử này không lớn như hai trường hợp trước, TechRadar vẫn cho rằng ChatGPT nhỉnh hơn về độ hoàn thiện tổng thể.
TechRadar nghiêng về khả năng Nano Banana 2 không thực sự suy giảm, mà cảm giác bị “tụt lại” chủ yếu đến từ việc ChatGPT đã cải thiện nhanh trong vài tháng gần đây. Theo phân tích này, nếu Nano Banana 2 gần như giữ nguyên mặt bằng chất lượng cũ, việc người dùng cảm thấy mô hình yếu đi so với đối thủ là điều dễ xảy ra. Dù vậy, Gemini vẫn có lợi thế về tốc độ tạo ảnh so với ChatGPT.
Vì vậy, trọng tâm tranh cãi hiện không chỉ nằm ở câu hỏi liệu mô hình tạo ảnh của Google có giảm chất lượng hay không, mà còn xoay quanh cách Gemini diễn giải prompt và tốc độ nâng cấp của đối thủ. Chất lượng ảnh mà người dùng cảm nhận được cũng có thể thay đổi tùy vào mô hình văn bản đứng sau khâu đọc chỉ dẫn và cách hệ thống phối hợp các mô hình liên quan.
Cuộc tranh luận này cho thấy chất lượng ảnh AI không còn được đánh giá chỉ bằng năng lực tuyệt đối của từng mô hình, mà ngày càng được đặt trong tương quan với tốc độ cải tiến của đối thủ và kỳ vọng ngày một cao của người dùng. Theo TechRadar, việc Google có tiếp tục tinh chỉnh mô hình tạo ảnh hoặc hệ thống diễn giải prompt để thu hẹp khoảng cách về chất lượng cảm nhận sẽ là điểm đáng chú ý trong thời gian tới.