ニュース

しゃべるAIが“顔”付きに ~Google、「Gemini 3.8 Live with Live Avatar」を発表

97言語でリップシンクと表情が追従。日本語にも対応

「Gemini 3.8 Live with Live Avatar」を発表

 米Googleは9月24日(現地時間)、「Gemini 3.8 Live with Live Avatar」を発表した。先週発表した音声対話モデル「Gemini 3.8 Live」に、声に合わせて動くアバター機能「Live Avatar」を追加したもので、同日より「Gemini Enterprise」で提供される。

 人が会話するとき、ただ音声をやり取りするのではない。相手を見て、その表情を通じても情報をやり取りしている。つまり、会話はもともと“マルチモーダル”(複数種の情報をまとめて処理すること)といえる。

 こうした発想をもとに開発されたのが、今回発表された「Gemini 3.8 Live with Live Avatar」だ。ネイティブな音声対話に低遅延の映像生成を組み合わせ、聞き、見て、話すという一連のやり取りを、動きのある“見た目”を持ったキャラクターが行うことで、より自然な会話を実現することを目指しており、カスタマーサービスや対話型の操作案内といった用途を想定しているという。

アバターの例

 また、「Gemini」の推論能力も活かされており、非同期のツール呼び出しに対応するのも特徴。つまり、会話を続けながら情報を手繰り寄せて、考える能力も備えており、複雑な処理を挟んでも会話が途切れない。

 対応言語は97言語で、日本語も含まれる。会話中に言語を切り替えても、精密なリップシンク(口の動きの同期)や自然な表情を保てるとのこと。

 アバターはあらかじめ用意されたライブラリから選べるが、組織独自のカスタムアバターを作ることも可能。高品質な参照画像をもとに、人物の特徴やブランドのスタイルを保ちながら、会話に合わせて動くアバターを生成できる。同社のAI製品が生成した出力にはすべて電子透かし「SynthID」が埋め込まれるが、「Live Avatar」もその対象で、音声と映像の両方に埋め込まれ、AIが生成したコンテンツであることを後から検出できる。

 なお、カスタムアバターを利用できるのは、今のところGoogleから許可を受けた一部の企業に限られる。また、現時点でアバターを用いた連続対話は数分程度に過ぎず、何時間も続く対話には対応していない。