写真=端末前約1mの音声だけを拾う「AIボイスバブル」のデモ

Qualcommは、スマートフォンの周囲にいる人の声や拍手などを抑え、端末前約1mで話す人の声だけを通話相手に届ける音声AI機能「AIボイスバブル」を披露した。米ハワイ州マウイで22〜24日(現地時間)に開催された「Snapdragon Summit 2026」のデモルームで実演した。

デモでは、端末前の一定範囲内で発した日本語と英語の音声は受話側のスピーカーから再生された一方、その範囲外からの歓声や拍手は聞こえなかった。Qualcommの担当者は、この機能を「AIボイスバブル」と呼んで説明した。スマートフォンのマイクとオンデバイスAIを使い、端末の周囲に約1mの“バブル”を形成し、その内側の音声だけを通話に乗せる仕組みだという。

構成は、スマートフォン同士を通話接続し、受話側の音声をブース背面のBluetoothスピーカーから出力する形だった。

担当者が話しながら端末から離れると、スピーカーから流れていた音声は途切れた。バブルの外側から徐々に声を張り上げ、手をたたいても、スピーカーは反応しなかった。マイク自体は周囲の音を拾っていても、AIが不要な音として判別し、通話には乗せないという。

再び端末の前に戻ると、音声はすぐに再生された。バブル内で発した手の雑音も除去され、話者の声だけが相手に伝わった。

端末の前で「こんにちは、はじめまして」と日本語で話し、その後に英語のフレーズを交互に発すると、音声はそのままスピーカーから出力された。担当者は「あなたの声だけを拾って伝送している」と説明した。

日本語と英語を交えて3回発話した場面でも、バブル内の音声は途切れなかった。受話側では、ブース周辺のざわめきではなく、話者の声だけが残る形となった。

◆通話や文字起こし、翻訳の精度を左右

Qualcommによると、スマートフォンは複数のマイクに音が届く時間差を基に、話者との距離を推定する。各マイクへの到達時間を計算し、端末前に約1mの領域を設定したうえで、その範囲内の音声に反応する仕組みだ。声とそれ以外の音を識別する処理は、端末内のAIが担う。

同社は、この音声選別技術をエージェント型AIと組み合わせていく考えだ。音声はAIアシスタントやエージェントを呼び出す主要なインターフェースになりつつあり、通話、メッセージの文字起こし、会話翻訳、AIアシスタントとの対話はいずれも収音品質の影響を受けると説明した。

Qualcommは、オーディオプラットフォーム「Snapdragon Sound Elite」第2世代でも、Qualcomm CVCにAI音声技術を追加した。イヤホン装着中に、より安い価格を探したり予定変更を音声で依頼したりすると、エージェントが関連サービスと連携して処理するユースケースも紹介した。

周辺音を検知する機能も盛り込んだ。ノイズキャンセリングを有効にした状態で都市部を歩いている際、サイレンが近づくと適応型ANCがこれを検知し、外音取り込みモードへ切り替えて周囲の音を聞かせる仕組みだという。

なお、「AIボイスバブル」は現時点で正式名称ではない。担当者は「なぜバブルと呼ぶのか」との質問に対し、機能を分かりやすく説明するための社内呼称だとしたうえで、「製品化の段階では別の名称になる可能性がある」と述べた。最終的な名称はOEM各社の実装次第で決まるという。

キーワード

#Qualcomm #Snapdragon Summit #オンデバイスAI #音声AI #Snapdragon Sound #ANC
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.