搜索关键词 多模态输入
AI & Enterprise
MiniMax发布视频生成模型H3 拟于数日内开源权重
据路透社报道,中国AI公司MiniMax发布视频生成模型H3,支持文本、图像、视频和音频等多模态输入,最高可生成2K分辨率、时长15秒的视频,并支持原生立体声。MiniMax还计划在数日内开源权重,供用户下载和自行修改,与ByteDance、Kuaishou等公司在视频生成赛道展开竞争。
AI & Enterprise
Microsoft“Copilot OS”原型曝光,代号“Ion”
外媒援引2024年流出的资料称,Microsoft正在开发代号为“Ion”的“Copilot OS”原型。该系统采用基于Web技术构建的界面,并依托Microsoft Edge浏览器运行,可作为Windows 11的替代性桌面外壳,也可适配AOSP平台,但仅支持Web应用;传统Windows应用需通过Windows 365云PC提供。
AI & Enterprise
Google发布多模态AI模型Gemini Omni:可基于文本、图片和音频生成视频
Google在I/O开发者大会上发布多模态AI模型Gemini Omni,能够联合理解文本、图片、音频和视频,并用于视频生成。首个版本Gemini Omni Flash已率先接入Gemini应用、YouTube Shorts和创作工具Flow,所有生成视频均嵌入SynthID数字水印;数字分身功能需单独完成注册,API预计将在未来几天内开放。