Hình ảnh tháp đồng hồ steampunk do ChatGPT Image 2.5 tạo ra. Ảnh: ChatGPT

OpenAI cho biết mô hình tạo ảnh mới ChatGPT Image 2.5 đã khắc phục nhược điểm làm nét quá đà từng bị phàn nàn ở phiên bản trước. Tuy vậy, khi đặt cạnh Nano Banana 2 của Google, kết quả thử nghiệm cho thấy chênh lệch không đáng kể. Trong 6 hạng mục đánh giá, mỗi mô hình giành ưu thế ở 3 tiêu chí.

Theo Decrypt ngày 12/9 giờ địa phương, ChatGPT Image 2.5 nổi bật ở khả năng xử lý bố cục không gian trong các cảnh phức tạp, tái hiện bầu không khí và tạo hình minh họa. Trong khi đó, Nano Banana 2 ổn định hơn ở các chi tiết có thể kiểm chứng, như văn bản và mốc thời gian xuất hiện trong ảnh.

OpenAI ra mắt ChatGPT Image 2.5 hôm 8/9 và nhấn mạnh các thế mạnh như độ chi tiết cao, chất liệu phong phú, ánh sáng tự nhiên và khả năng chỉnh sửa chính xác. Công ty cho biết năng lực biên tập ảnh, đồng thời giữ nguyên những yếu tố người dùng yêu cầu không thay đổi, đã được cải thiện. Độ trễ tạo ảnh cũng giảm tối đa 50% so với Image 2.0.

Trên API, OpenAI bổ sung hai mô hình mới là GPT-Image-2.5 Flare và GPT-Image-2.5 Sunburst. Trong đó, Flare hướng đến nhu cầu tạo ảnh cơ bản với tốc độ cao, còn Sunburst là phiên bản cao cấp hơn, tập trung vào khả năng chỉnh sửa chính xác.

Bài thử lần này là phần tiếp theo của cuộc so sánh được thực hiện vào tháng 5. Khi đó, mô hình của OpenAI bị chỉ ra tình trạng độ sắc bị đẩy quá cao khi xử lý prompt có nhiều ràng buộc.

Ở thử nghiệm mới, hạn chế này hầu như không còn rõ rệt. Với các cảnh steampunk và ảnh chân dung, ChatGPT Image 2.5 tái hiện tương đối ổn định những khung hình phức tạp, không còn tạo cảm giác ám vàng quá mức hay như bị xử lý hậu kỳ nặng.

Dù vậy, trong các tình huống đòi hỏi độ chính xác chi tiết, Nano Banana 2 lại cho thấy lợi thế. Ở bài kiểm tra với cảnh ngã tư đô thị có nhiều chữ, mô hình của Google thể hiện phần lớn dòng chữ khá rõ và dễ đọc.

Ngược lại, ChatGPT Image 2.5 không tái hiện đúng dấu nháy đơn trong “KELLERMAN'S”, khiến một số chữ khó đọc, đồng thời mắc lỗi chính tả ở vài cụm từ theo phong cách street art. Dù tổng thể khung cảnh có độ chân thực cao, Nano Banana 2 vẫn vượt trội hơn về độ chính xác của văn bản trong ảnh.

Ở hạng mục bố cục không gian và khả năng truyền tải bầu không khí, ChatGPT Image 2.5 được đánh giá cao hơn. Với bài toán tạo hình ảnh tháp đồng hồ, mô hình này tái hiện tự nhiên hơi nước, dòng sông và chênh lệch sắc độ theo phối cảnh, từ đó tạo chiều sâu hình ảnh tốt hơn.

Theo bài đánh giá, ChatGPT Image 2.5 bám khá sát yêu cầu đầu vào nhưng vẫn giữ được tính chân thực. Nano Banana 2 thể hiện chữ số La Mã dễ đọc hơn, song thời gian trên mặt đồng hồ lại không khớp hoàn toàn với prompt.

Với những cảnh thiên về minh họa, ChatGPT Image 2.5 cũng nhận phản hồi tích cực. Ở bài toán “biến hình” theo phong cách hoạt hình, mô hình này được đánh giá cao về phần bầu trời và mức độ hoàn thiện thị giác, dù vẫn gặp hạn chế khi chuyển tải yêu cầu theo nghĩa trực diện. Thay vì thể hiện nhân vật tan chảy thành năng lượng, hệ thống lại diễn giải bằng cách thêm hiệu ứng điện quanh tóc. Nano Banana 2 bám sát mô tả hơn, nhưng chất lượng hoàn thiện tổng thể vẫn kém ChatGPT Image 2.5.

Với ảnh chân dung thực tế, mỗi mô hình có một điểm mạnh riêng. Trong bài mô tả một kiến trúc sư trên sân thượng, ChatGPT Image 2.5 cho kết quả tốt ở ánh sáng và kết cấu da, nhưng vẫn có xu hướng làm da quá mịn.

Nano Banana 2 lại không đặt đúng vị trí bản vẽ blueprint, song bố cục tổng thể và phần thể hiện nhãn tài liệu ổn định hơn. Bài đánh giá cũng nhận định Nano Banana 2 đủ sức cạnh tranh ở ảnh tạo ngay từ lần đầu, nhưng nếu xét cả các vòng chỉnh sửa lặp lại, ChatGPT Image 2.5 có lợi thế rõ hơn.

Khác biệt lớn nhất xuất hiện ở nhóm ảnh dựa trên dữ kiện cần kiểm chứng. Cả hai mô hình đều hỗ trợ tạo ảnh dựa trên việc tra cứu tài liệu, nhưng với infographic dòng thời gian Bitcoin, ChatGPT Image 2.5 lại ghi sai một mốc năm quan trọng. Cụ thể, mô hình này cho rằng Mỹ phê duyệt ETF Bitcoin giao ngay vào năm 2023, trong khi ETF Bitcoin giao ngay đầu tiên tại Mỹ được phê duyệt vào ngày 10/1/2024.

Nano Banana 2 cũng không sắp xếp infographic này một cách hoàn hảo, nhưng mô hình đã gom mốc phê duyệt ETF Bitcoin và lần halving thứ tư vào giai đoạn 2023-2024, qua đó tránh đưa ra một thông tin sai theo cách khẳng định chắc chắn.

Theo bài đánh giá, lỗi sai về ngày tháng nhưng lại được thể hiện với mức độ chắc chắn là vấn đề nghiêm trọng hơn so với hạn chế thuần túy về thiết kế. Điều này cho thấy với nội dung do AI tạo sinh dựa trên dữ kiện, độ chính xác thông tin có thể trở thành tiêu chí cốt lõi, bên cạnh chất lượng hình ảnh hay bố cục.

Ở chiều ngược lại, ChatGPT Image 2.5 chiếm ưu thế trong hạng mục hình dung các từ ghép vô nghĩa hoặc khái niệm trừu tượng. Mô hình có thể đưa những từ không có nghĩa cố định lên biển hiệu và chữ in trên hộp boardgame. Bài đánh giá xem đây là một thế mạnh khi chuyển các khái niệm chưa được định nghĩa thành yếu tố thị giác có thể đọc được. Nano Banana 2 tạo ra khung cảnh ấm áp và giàu màu sắc văn hóa, nhưng không thể hiện rõ từ ghép xuất hiện trong prompt ngay trong hình ảnh.

Bên cạnh mô hình tạo ảnh, OpenAI cũng bổ sung một số tính năng liên quan. Người dùng có thể phác thảo trực tiếp trong ChatGPT để dựng bố cục sơ bộ, chia sẻ prompt và để lại bình luận nội tuyến theo từng vùng ảnh. Công ty cũng cung cấp các mẫu có thể dùng cho poster và sản phẩm. Trên API, thang chất lượng được mở rộng với hai mức mới là “high” và “max”.

Tổng thể, cuộc so sánh lần này cho thấy thế cân bằng giữa hai mô hình. ChatGPT Image 2.5 đã xử lý được một lỗi điển hình của thế hệ trước và tạo ra nhiều kết quả ấn tượng, trong khi Nano Banana 2 ổn định hơn ở các chi tiết có thể kiểm chứng như chính tả, ngày tháng và ký hiệu. Điểm mấu chốt của cuộc đua không nằm ở chất lượng hình ảnh tổng thể, mà ở những sai sót nhỏ nhưng có thể kiểm tra được, như chữ viết sai hoặc nhầm mốc thời gian.

Từ khóa

#OpenAI #ChatGPT Image 2.5 #Nano Banana 2 #mô hình tạo ảnh AI #trí tuệ nhân tạo #API #infographic
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.