写真=Shutterstock

Microsoftは、リアルタイム文字起こし1モデルと音声合成2モデルの計3種類の音声AIモデルを公開した。新たにストリーミング文字起こしに対応し、音声AI関連のモデル群を拡充する。

米SiliconANGLEが2日(現地時間)に報じた。今回の中心となるのは、同社初のストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」だ。音声をリアルタイムでテキスト化し、発話中も認識結果を逐次更新する。発話終了後に最終結果を確定する仕組みだ。

用途としては、リアルタイム字幕表示のほか、ユーザーが話し終える前にリクエスト処理を始めるアプリケーションなどを想定する。

「MAI-Transcribe-2-Streaming」は、初回の認識結果を平均320ミリ秒以内に返す。60以上の言語に対応し、使用言語の自動検出にも対応する。価格は音声1時間当たり0.54ドル(約81円)。

音声合成モデルは「MAI-Voice-2.1」と「MAI-Voice-2.1-Flash」の2種類。「MAI-Voice-2.1」は表現力と音質を高めたモデルで、「MAI-Voice-2.1-Flash」は性能を一部抑える一方、応答速度とコスト効率を重視した。いずれも23言語に対応する。

Microsoftは先月、非ストリーミング型の文字起こしモデル「MAI-Transcribe-2」も公開している。価格は音声1時間当たり0.10ドル(約15円)で、ストリーミング型に比べて5倍以上安い。ストリーミング型は、音声入力中に暫定結果を継続的に返す必要があるため、処理負荷が高いという。

今回のモデル追加は、Microsoftによる自社開発モデルの拡充戦略の一環とみられる。Microsoft AIの最高経営責任者(CEO)、ムスタファ・スレイマン氏は7月、OpenAIやAnthropicの高性能モデルを巡るコスト負担への懸念が強まる中、MAIモデル群の強化を強調していた。SiliconANGLEによると、同社はExcelやOutlook上のCopilotエージェントに自社モデルを適用することを目指している。

キーワード

#Microsoft #人工知能 #音声AI #ストリーミング文字起こし #音声合成 #MAI
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.