FLUX 3不仅面向视频生成,也被Black Forest Labs用于拓展机器人控制场景。图片来源:Black Forest Labs

Black Forest Labs发布了首款视频生成模型FLUX 3。与以往产品不同,这款模型不仅能够生成视频,还可同步生成与画面匹配的对白、音效和背景音乐。公司同时披露,FLUX 3后续将不只用于内容生成,还将作为机器人控制的基础模型进一步推进落地。

据加密货币媒体Decrypt 23日(当地时间)报道,FLUX 3是一款多模态AI模型,最长可生成20秒视频。这也是此前主要聚焦静态图像生成的FLUX系列,首次将能力扩展至视频、音频以及机器人相关场景。

从技术架构看,FLUX 3采用统一系统,对图像、视频和音频进行联合训练,因此在生成视频时,能够更自然地输出与画面相匹配的语音、音效和配乐。

不过,目前FLUX 3仍处于早期接入阶段。视频生成和动作相关能力将优先通过API向部分合作伙伴开放,相关图像生成能力预计将在数周内补充上线。可本地部署的开放权重版本目前仅规划为FLUX Dev,预计于2026年下半年发布。

Black Forest Labs还强调了FLUX 3的性能表现。根据人类偏好评测结果,在由评审对两组生成结果进行对比并选出更优视频的测试中,FLUX 3相较Runway Gen-4.5的胜出比例为77%,相较Luma Ray 3.2为93%。公司称,与Google Gemini Omni和Seedance相比,FLUX 3也在52%的评测中占优。不过,这一结果并非定量基准测试,而是基于人工偏好的对比评估。

除内容生成外,Black Forest Labs还将FLUX 3定位为“Physical AI”基础模型。联合创始人兼CEO Robin Rombach表示,只学习图像的模型只能生成图像,而视频预测过程则是在学习重量、接触和时序等现实物理规律。

基于这一方向,公司进一步推出了机器人AI模型FLUX-mimic。该模型由苏黎世初创公司Mimic Robotics联合开发,在FLUX 3的视频预测引擎基础上结合轻量级解码器,可将视频中的运动转换为真实机器人动作。

目前,Audi已在生产线上测试这项技术,应用于汽车门封条安装环节。这类柔性材料装配任务,通常较难通过传统自动化设备完成。Mimic Robotics联合创始人Stefan-Daniel Gravert表示,Audi是FLUX-mimic在制造场景中的代表性案例。Audi的Christoph Schneider也称,机器人已经能够执行此前自动化设备难以处理的复杂柔性物体操作任务。Black Forest Labs表示,整套系统的响应时延约为101毫秒,接近人类视觉反射速度。

此次发布也被视为Black Forest Labs业务方向调整的一个信号。该公司成立于2024年,由Stability AI早期Stable Diffusion开发团队成员创立,曾凭借早期FLUX模型与Midjourney竞争而受到关注。其中,开放版本FLUX Dev和FLUX Schnell在开源图像生成市场获得较高评价,但之后推出的FLUX.2未能延续此前声量。

Black Forest Labs希望借助FLUX 3,将以图像生成为主的业务版图扩展至视频生成和机器人领域,以寻找新的增长空间。

不过,FLUX 3当前的核心能力仍有一定开放限制。视频生成和动作能力仅面向API及部分合作伙伴提供,开放权重模型也要等到2026年下半年才会发布。业内预计,FLUX 3后续的市场扩散速度,将取决于API开放范围的扩大以及合作伙伴生态的建设进展。

关键词

#Black Forest Labs #FLUX 3 #多模态AI #视频生成 #音频生成 #Physical AI #机器人控制 #FLUX-mimic #Mimic Robotics #Audi
版权所有 © DigitalToday。未经授权禁止转载或传播。