ESPN DeportesLa era de Rafael Márquez inicia con frío reencuentro en BaltimoreESPNFollow live: Bijan Robinson finds end zone a second time as Falcons take controlThe Jerusalem PostCalls increase to remove Pink as UNICEF ambassador over Macklemore criticismPunchGambia’s central bank faces criticism over foreign worker orderالنهارأسعار المشتقات النفطية في عام 2026... لماذا يسبق الديزل والبنزين النفط؟한겨레[속보] 조광희·김효빈, 카약 4인승 이어 2인승도 우승…한국 첫 2관왕 탄생RapplerCOA sounds alarm as pests feast on stash of disaster supplies in warehousesUOLTrump 'estende' tapete vermelho para Xi, que retribui: 'Novo capítulo'Antara NewsIndonesia Ambassador backs ANTARA plan to reopen US bureauNew Straits TimesAzmoun makes Iran return months after World Cup snubLenta.ruСтало известно о прошедших в США переговорах по УкраинеSportstarAsian Games 2026 Live Updates, Day 7: India's Suruchi-Kamaljeet in action in 10m air pistol mixed team final; mixed doubles medals confirmed in table tennis and squash; badminton scores
The Daily Newsstand · Free, Always
Friday, September 25, 2026

[ITmedia News] Google、リアルタイムで表情豊かに話すAIアバター「Gemini 3.8 Live with Live Avatar」提供開始 画像1枚で独自アバターも

Translate

 米Googleは9月24日(現地時間)、リアルタイム音声対話モデル「Gemini 3.8 Live」に、ほぼリアルタイムで動画を生成するアバター機能「Live Avatar」を組み合わせた「Gemini 3.8 Live with Live Avatar」を発表した。同日から、企業向けの「Gemini Enterprise」で一般提供を開始した。「Google Cloud Next 2026」で先行公開していた技術を、企業が本番環境で使えるようにした。

(画像:Google)

 Live Avatarは、9月15日に公開したGemini 3.8 Liveの対話機能と、低遅延の映像ストリーミングを一体化したもの。ユーザーの声を聞き、カメラ映像を見ながら、発話に合わせて口が動くアバターの映像と音声で応答する。表情も自然に変わり、話し手の交代も滑らかという。カメラ映像や画面共有を音声と同時に処理できるため、ユーザーが見ているものをアバター側も把握しながら会話を進められる。

 同社のシュアイブ・ネムリ氏が個人のXアカウントで、自身の画像を元に生成したアバターの動画を投稿している。

 会話を止めずに裏でツールを実行する3.8 Liveの非同期ツール呼び出しにも対応する。デモ動画では、ホテルのチェックイン手続きで、アバターが客との会話を続けながら、裏でツールを呼び出して手続きを進める様子を紹介している。対応言語は日本語を含む97言語。会話の途中で言語が切り替わっても、映像の品質を落とさず、見た目のずれも生じさせずに、リップシンクや表情を追従させられるとしている。

 このサービスの狙いは、企業がオンライン上のサービスを、より対話的に展開できるようにすることとしている。想定する用途は、顧客対応や、手順を対話形式で案内するウォークスルーなどで、Web、モバイルアプリ、店頭などに置くキオスク端末での利用を見込む。

 許諾を得た従業員や契約タレントの姿を基にしたブランドの案内役、ECの買い物アシスタント、ゲームのNPCなども例に挙げている。導入事例として、米Cox Automotiveが自動車情報サイト「Autotrader」向けに、会話しながら車両の検索や比較、ローンの相談を案内するアバター型アシスタントを構築したことを紹介した。

 アバターの生成について、モデルカードでは、設定した画像と音声入力を基に、自然な頭の動きと発話に同期した表情豊かな動画を生成すると説明している。3.8 Liveを含む音声モデル群「Gemini 3.8 Audio」は「Gemini 3 Pro」をベースにしている。アバターを使う場合の出力は音声、動画、テキストで、出力の上限は2万4000トークン(アバターなしの場合は6万4000トークン)。連続して対話できるのは数分程度で、数時間に及ぶ利用は想定していないとしている。

 アバターは、Googleが用意した多様なプリセットのライブラリから選び、既定の音声と組み合わせて使う。企業独自のアバターも作成できる。高品質な参照画像1枚を基に、元の人物の似姿やブランドのスタイル、キャラクターの特徴を保ったまま、動いて応答するアバターを生成する。デモでは、システム指示を設定した上で、参照写真1枚と音声のサンプルファイルをアップロードする手順を紹介している。ただし、カスタムアバターの作成は、Googleの許可リストに登録された企業に限って提供する。

 安全対策としては、なりすましなどの悪用を防ぐため、カスタムアバターの作成に許可リストへの登録と厳格な検証の手続きを設けた。生成した音声と映像にはすべて電子透かし「SynthID」を埋め込み、AIが生成したコンテンツであることを検出できるようにしている。モデルカードによると、社内の安全・責任チームと連携して、人による評価やレッドチーミング、子どもの安全に関する評価などを実施したという。

 利用できるのは企業顧客で、Google Cloudのコンソールで試せるほか、Live API経由で自社のサービスに組み込める。米国とEUのエンドポイントで提供し、処理能力をあらかじめ確保する「プロビジョンドスループット」にも対応する。推論を強化した「Gemini 3.8 Live Extended Thinking」は、引き続き限定プレビューの段階にとどまる。

 料金は従量課金制で、100万トークン当たり、アバター映像の出力が1ドル。その他はテキスト入力が0.75ドル、画像・動画入力が1ドル、音声入力が3ドル、テキスト出力が4.5ドル、音声出力が12ドル。アバター映像は1秒当たり6192トークンとして計算する。課金対象はアバターが話している時間だけで、ユーザーの話を聞いている待機中は課金しない。なお、Live APIでは会話のターンごとに、それまでに蓄積したトークンも改めて課金対象となる。

View the original on ITmedia →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.