ESPN DeportesNFL: Jahmyr Gibbs se convirtió en la figura de la Semana 3InquirerPiston prefers tax-free oil products to P1 fare hikeESPNNo. 8 Liberty keep foot on gas to eliminate top-seeded LynxDaily MaverickMexico’s National Guard debuts tiny Chihuahua recruitThe Jerusalem PostCanadian Jews considering immigration to US under Trump amid increasing fear of antisemitismUOLVínculos com Lula, Flávio Bolsonaro e Cláudio Castro marcam debate entre candidatos no RJХабрGreenplum как расширение PostgreSQL 19SCMP ChinaSlow is beautiful: China launches war against AI drama, goes beyond algorithmsBusiness AMBusiness AM Sudoku’s 30-09-2026La Tercera“El Estado se habría quedado con un solo proveedor”: FNE explica por qué no pidió excluir de contratos públicos a empresas acusadas de colusión por vales de alimentaciónColliderThe 10 Best Stephen King Audiobooks, RankedLenta.ruВ России указали на препятствия Евросоюза на пути к мирным переговорам
The Daily Newsstand · Free, Always
Wednesday, September 30, 2026

DeepL、音声から音声翻訳がついに正式版に ChatGPT・Claude連携も

Translate

DeepLジャパンは29日、リアルタイム音声翻訳サービス「DeepL Voice」の新機能やMCP対応に関する報道関係者向け説明会を開催した。一般提供を開始した音声から音声へのリアルタイム翻訳機能や、Windows/Mac向けデスクトップアプリなどを紹介した。

音声から音声への翻訳が遂に正式リリース

DeepL Voiceは、2024年11月に発表された高精度のリアルタイム音声翻訳サービス。主なソリューションとして、Web会議向け「DeepL Voice for Meetings」と、対面会話向け「DeepL Voice for Conversations」の2つを用意する。これまでは音声からテキストへの翻訳を展開してきたが、新たに音声から音声へのリアルタイム翻訳(音声間翻訳)の一般提供を開始した。

音声間翻訳は25年10月に開発中の新機能として発表され、26年4月からベータ版として早期アクセスを実施していた。同機能は、一般提供にあわせて投入した「Voice AIモデル」により、話すテンポや抑揚、ピッチ、トーンなどを反映しながら、別の言語の音声へリアルタイムに翻訳できる。

同機能は30以上の言語に対応し、このうち日本語、英語、中国語、ドイツ語など14言語では、元の話者の声質を維持したまま翻訳音声を生成する「スピーカーマッチ」を利用できる。

スピーカーマッチでは、あらかじめ用意された合成音声で翻訳文を読み上げるのではなく、その場で発話された音声をリアルタイムに解析し、話者の声質に似せた音声を生成する。事前に話者の音声を登録する必要はなく、複数人が参加する会議でも、翻訳後の音声から誰が話しているのかを判別しやすくする。

処理した音声データは利用後にサーバーに残さず削除するため、個人情報保護やセキュリティを重視するエンタープライズ企業でも安心して利用できるという。

音声モデルはDeepLが自社でトレーニングしているが、言語によってはサードパーティの音声モデルを利用しており、自社モデルを使用していない言語ではスピーカーマッチに対応しない。

説明会では、日本語と韓国語による音声間翻訳のデモを実施。実際に試したところ、発話から翻訳音声が再生されるまでの遅延は体感で1秒未満から数秒程度で、会話が妨げられるほどの遅れは感じられなかった。翻訳後の音声にも元の話者の声質や話し方の特徴が反映され、異なる言語を使う相手とも会話を続けやすい印象だった。

日本語と韓国語による音声間翻訳のデモ。翻訳のテキスト表示のほか、話者の声質に似せた音声もリアルタイムで再生される

Web会議やグループ会話をより使いやすく

オンライン会議向けのDeepL Voice for Meetingsでは、Windows/Mac用デスクトップアプリを展開する。

従来のWeb版では、翻訳機能を利用する際にWeb会議の参加リンクをDeepLの画面へ貼り付け、翻訳用ボットを手動で会議に参加させる必要があった。デスクトップアプリでは、Zoom、Microsoft Teams、Google MeetのWeb会議を自動検出し、ワンクリックで連携できるようにした。

対面会話向けのDeepL Voice for Conversationsでは、「グループ会話」機能を追加。主催者が作成したバーチャルな会話ルームに、参加者がそれぞれの端末から入り、最大20人が希望する言語の翻訳音声や字幕を確認しながら会話できる。

従来のように1台のスマートフォンを参加者間で受け渡す必要がなく、各自の端末で翻訳を確認できる。主催者以外はDeepL Voiceのライセンスやアプリを用意する必要もなく、QRコードを読み取ってブラウザから参加できる。

DeepL Voice for Conversationsでのグループ会話のデモ

説明会では、DeepLのModel Context Protocol(MCP)対応についても紹介された。同社は22日、Microsoft Copilot、ChatGPT、ClaudeなどからDeepLを直接利用できるMCP対応を発表している。

これにより、各AIサービスを離れることなく、DeepLによるテキスト・ドキュメントの翻訳や、自社の用語集やカスタムルールを適用した翻訳を利用できる。

たとえば、AIを使った作業中に翻訳が必要になった場合、文章をDeepLへコピーして翻訳し、その結果を再びAIへ貼り付ける必要がなく、一連の作業をそのまま進められる。

よりスムーズな音声間翻訳へ

今後の開発では、音声間翻訳における遅延の削減に注力する。現在のDeepL Voiceでは、発話された音声のテキスト化、別の言語への翻訳、翻訳結果の音声出力の3段階の処理を、それぞれ別のモデルが順番に行なっている。

この方式では、各モデル間でデータを受け渡す必要があるため、その分だけ処理に時間がかかる。DeepLでは現在、音声の入力から翻訳音声の出力までを1つのモデルで処理する統合モデルの開発を進めているという。

モデルを統合することで遅延を抑えるとともに、翻訳ルールの柔軟な制御や品質向上を図り、よりリアルタイム性の高い音声通訳の実現を目指す。

異なる言語を話す相手とのコミュニケーションでは、AIグラスを活用した翻訳機能も複数登場している。たとえば、MetaのAIグラスでは「ライブ翻訳」によりMeta AIアプリで翻訳内容を確認できるほか、「Rokid スマートAIグラス」などディスプレイを備えたAIグラスでは、視界上に翻訳内容を表示し、相手から目線を外さずに会話できる。

DeepLは現状、自社でAIグラスなどのハードウェアを展開する予定はないという。だが、音声翻訳機能のAPIを提供しているため、メーカーや開発者がDeepLの機能を組み込み、スマートグラスなどで翻訳結果を表示・出力するアプリを開発することは可能としている。

View the original on Impress Watch →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.