Black Forest Labs vừa công bố FLUX 3, mô hình AI tạo video đầu tiên của hãng có khả năng tạo đồng thời hình ảnh động và âm thanh. Cùng với sản phẩm mới, công ty cũng cho thấy tham vọng đưa FLUX vượt ra ngoài vai trò công cụ tạo nội dung để trở thành nền tảng công nghệ cho Physical AI và điều khiển robot.
Theo Decrypt ngày 23/7 (giờ địa phương), FLUX 3 là mô hình AI đa phương thức có thể tạo video dài tối đa 20 giây, đi kèm lời thoại phù hợp với cảnh quay, hiệu ứng âm thanh và nhạc nền. Đây là lần đầu tiên dòng FLUX, vốn tập trung vào tạo ảnh, mở rộng sang video, âm thanh và xa hơn là robot.
Về công nghệ, FLUX 3 sử dụng một kiến trúc học thống nhất cho ảnh, video và âm thanh. Nhờ đó, mô hình có thể tạo giọng nói, hiệu ứng và nhạc nền bám sát nội dung hiển thị trong video.
Tuy nhiên, sản phẩm hiện mới ở giai đoạn truy cập sớm. Khả năng tạo video và mô hình hành động trước mắt được ưu tiên cung cấp qua API cho một số đối tác, trong khi tính năng tạo ảnh dự kiến sẽ được bổ sung trong vài tuần tới. Phiên bản công khai dưới dạng trọng số mô hình, có thể chạy cục bộ, hiện mới có FLUX Dev và dự kiến phát hành vào nửa cuối năm 2026.
Black Forest Labs nhấn mạnh FLUX 3 có lợi thế cạnh tranh về chất lượng đầu ra. Trong các bài đánh giá dạng so sánh trực tiếp giữa hai kết quả, mô hình này được người chấm lựa chọn nhiều hơn 77% so với Runway Gen-4.5 và 93% so với Luma Ray 3.2. Công ty cũng cho biết FLUX 3 chiếm ưu thế trong 52% lượt đánh giá khi so với Google Gemini Omni và Seedance. Tuy vậy, đây không phải benchmark định lượng mà là kết quả dựa trên mức độ ưa thích của người dùng.
Song song với FLUX 3, Black Forest Labs cũng công bố chiến lược dùng mô hình này làm nền tảng cho “Physical AI”. Đồng sáng lập kiêm CEO Robin Rombach cho rằng mô hình chỉ học từ ảnh sẽ chỉ tạo ra ảnh, trong khi việc dự đoán video theo thời gian giúp hệ thống học được các quy luật của thế giới vật lý như trọng lượng, tiếp xúc và thời điểm.
Hướng đi này được mở rộng sang một mô hình AI cho robot mang tên FLUX-mimic. Sản phẩm do Black Forest Labs và startup Mimic Robotics có trụ sở tại Zurich đồng phát triển, kết hợp bộ máy dự đoán video của FLUX 3 với một bộ giải mã nhẹ để chuyển các chuyển động trong video thành thao tác thực tế của robot.
Audi cho biết đã thử nghiệm công nghệ này trên dây chuyền sản xuất. Mục tiêu là công đoạn lắp gioăng cửa xe, một dạng lắp ráp vật liệu mềm vốn khó tự động hóa bằng thiết bị truyền thống. Đồng sáng lập Mimic Robotics Stefan-Daniel Gravert nhận định Audi là ví dụ điển hình cho môi trường sản xuất mà FLUX-mimic có thể được triển khai. Trong khi đó, Christoph Schneider của Audi đánh giá robot đã có thể đảm nhiệm những thao tác với vật thể mềm phức tạp, vốn là bài toán khó với các hệ thống tự động hóa hiện nay. Black Forest Labs cho biết độ trễ phản hồi của toàn hệ thống vào khoảng 101 mili giây, gần với tốc độ phản xạ thị giác của con người.
Động thái lần này cũng cho thấy Black Forest Labs đang điều chỉnh chiến lược kinh doanh. Công ty là startup được thành lập năm 2024 bởi nhóm phát triển ban đầu của Stable Diffusion tại Stability AI và từng thu hút chú ý khi đưa các mô hình FLUX đời đầu cạnh tranh với Midjourney. Những mô hình mở như FLUX Dev và FLUX Schnell từng được đánh giá cao trên thị trường tạo ảnh mã nguồn mở, nhưng FLUX.2 ra mắt sau đó không tạo được ảnh hưởng tương tự.
Với FLUX 3, Black Forest Labs đặt mục tiêu mở rộng hoạt động từ trọng tâm tạo ảnh sang tạo video và robot, qua đó tìm kiếm động lực tăng trưởng mới.
Dù vậy, các chức năng cốt lõi của sản phẩm hiện vẫn còn bị giới hạn. Khả năng tạo video và mô hình hành động mới chỉ được mở qua API cho một số đối tác, còn phiên bản trọng số công khai sẽ không phát hành trong năm nay mà dự kiến tới nửa cuối năm 2026. Vì vậy, tốc độ phổ cập của FLUX 3 nhiều khả năng sẽ phụ thuộc vào việc mở rộng phạm vi API và xây dựng hệ sinh thái đối tác.