搜索关键词 语音转文本
AI & Enterprise
OpenAI发布GPT-Live-1 API:支持实时插话与边听边说
OpenAI面向开发者推出实时语音对话模型GPT-Live-1 API,主打可在通话过程中实现插话、轮替发言等更自然的交互体验。该模型基于全双工架构,可降低语音对话延迟并减少多模型之间信息传递带来的不稳定性;复杂推理与工具调用则可交由GPT-6 Astra等后端模型承担。其语音前端定价为0.05美元/分钟。
AI & Enterprise
Twelve Labs将视频检索模型Marengo接入Amazon Bedrock托管知识库
多模态视频理解AI公司Twelve Labs宣布,视频嵌入与检索模型Marengo已接入Amazon Bedrock托管知识库。借助AWS提供的数据接入、索引和检索能力,用户无需自建检索系统,即可通过自然语言在自有视频中快速定位目标画面。
AI & Enterprise
Krafton开源语音AI基础模型“A.X K2 Raon-Speech”,发力游戏角色语音交互
Krafton宣布在全球AI平台Hugging Face开源语音AI基础模型“A.X K2 Raon-Speech”。该模型结合SK Telecom的小型语言模型“A.X K2”与Krafton自研语音编码器、语音编解码器,可直接完成语音理解与生成,减少情感和语调信息损失。未来,公司计划将相关技术用于提升游戏中的CPC同伴角色实时语音交互能力。