[ITmedia News] 素材と完成動画を見せるだけ “型”を覚えたAIに動画編集をどこまで託せるか GPT-6 Astraで試す
8月下旬に、「ChatGPT」に米Adobeのプラグインを導入してクラウド上のツールを使って画像処理させるという方法を試した。静止画はかなりうまく動作するのに対し、動画は機能的にまだプアなこと、クラウド上に映像をアップロードしなければならないことなどの制約があり、十分とはいえない結果となった。
一方で9月にはデスクトップ版の「Premiere」が26.5にアップデートし、生成メディアツールが搭載された。以前から搭載されていた生成AIによるクリップ延長機能を拡張し、タイムライン上の特定部分に生成AI動画を直接プロンプトで指定できるようになった。
もちろんこれだけでも大きな進化だが、エージェンティックAIとの組み合わせでかなり高度な編集処理ができるはずだ。ローカルのPremiereはフル機能を持っており、プラグイン動作ではうまくできなかった処理もできる。
今回はPremiereと「GPT-6 Astra」の組み合わせを試してみた。
完成版から編集方法を学習させる
筆者はジャーナリスト西田宗千佳氏と共同でメールマガジンを発行しているが、「note」版への展開では毎週金曜日に、ショート動画を配信している。だいたい10分から15分ぐらい、モノローグでしゃべりを収録し、それを編集して10分以内のコンテンツにまとめている。
言い間違いや言い直したところをカットし、タイトルと音楽を追加しているだけである。筆者はそもそもがテレビの編集者であり、こうした編集には大して時間もかからない。さらに何度も同じ編集を行っているので、手順的にはかなり洗練されたものになっていると自負している。こうしたシンプルな作業なら、AIに学習させられるのではないかと考えたのがそもそもの発端である。
今回GPT-6 AstraとPremiereとの接続は、GPT側のプラグイン、「Computer Use」を使用した。これはGPTが画面操作を通じて他のアプリを操作できるという機能だ。人間が操作するUIをAIが操作するので、人間ができることは大抵できるというメリットがあるが、時間がかかるという弱点がある。
「Computer Use」があれば、GPTからローカルのアプリが操作できる
一方前回テストした「DaVinci Resolve」との接続では、DaVinci側でMCPサーバを立て、そこへGPTがアクセスする格好だった。MCPサーバは画面操作を経由せずアプリの機能を直接駆動できるので、より高速に動作できる。できることはサーバ側が実装・公開している機能の範囲に限られるが、Computer Useも併用できるので、応用範囲は広い。
手元には編集前の素材と、編集後の完成コンテンツがある。まずはそれをPremiereの新規プロジェクトへ読み込み、GPT-6 Astraに対してその差分を分析させ、どのように編集されたかをテンプレートとしてまとめさせた。
10分ほど考えたのち、編集テンプレートとしてMarkdown形式で出力された。毎回使用している音楽のパスも提供し、テンプレートに追加してもらった。ただこのままではPremiere上でどうなってるのか確認できないので、Premiereで読み込めるXML形式に変換してもらった。
読み込ませたものがこれである。最初にオープニングトークがあり、タイトルが挿入され、本編に入るという構成が再現されている。また途中に何カ所かインサートカットが入るということも再現されている。ただしインサートカットは毎回挿入場所も挿入内容も変わるので、毎回テンプレート通りになるわけではない。
ここからが本題だ。テンプレートはコンテンツのフォーマットを示したものにすぎず、編集するのは人間のままである。そこで今回の、素材と完成品を比較して得られた知見を、スキルという形で出力させる。
2分半ほど考えたのち、スキルとして出力された。形式はやはりMarkdown形式である。次回からは、スキルのパスを示せばGPTが編集してくれるのだという。
素材だけを放り込んでスキルで編集させる
では次に、別の収録素材を用意して、今回作成したスキルを使ってどのように編集されるのか、試してみた。
元の素材は約7分のトークだが、約17分ほど作業して、約5分のコンテンツにまとめてくれた。Premiereのタイムライン上で編集してくるのかと思ったら、GPT上で編集していきなり完成動画を提示してきた。
学習元になった完成動画と、これを解析して得られたスキルでAIが自動編集した結果を掲載しておく。内容は別のものだが、フォーマット的にはほぼ同じになっている。
学習元の完成動画
スキルを使ってAIが編集した別動画
オープニングタイトルも、内容に近いものが入っている。編集は、自分でやるならもう少し刈り込むところだが、切りすぎ感もない。Premiereでは文字起こししたテキストを編集すると、動画も編集されるという機能があるが、この機能を使うと言葉が切れたりするケースがあった。これに比べれば、はるかに不具合なくちゃんと編集できている。
ただ、自分で修正するためには、この編集成果をPremiere上のタイムラインにしてもらわなければならない。よってこの成果を、タイムラインとして再構築してもらった。
音楽は、本来はオープニングから薄くBGMレベルで挿入されているが、タイトルバックの無音部分しか検出できなかったようである。だがこれは筆者が前後に伸ばしてやればいいだけなので、問題ない。
またエンディングにも、しゃべりの終わり合わせで音楽が挿入されているが、これもしゃべり終わりの部分だけタイミングを合わせて挿入されていた。ここも筆者が音楽を前に伸ばしてやればいいだけなので、作業としては少ない。
タイトルの内容は、本当はオープニングトーク内で喋っているものと同じなのだが、本編の要約を挿入するものと思っているようだ。まあこれはこれで悪くないし、気に入らなければ自分で入力し直せばいいだけだ。
タイムラインを走らせて分かったのは、音声をちゃんとセンターに定位させているところだ。もともとのオリジナルファイルは、左チャンネルがラベリアマイク、右チャンネルがカメラマイクなので、左右でバランスがかなり崩れている。これまで完成動画では、カメラマイクの音声をカットし、ラベリアマイクの音声をセンターに定位させるという処理をしていた。
これも特に指示したわけではないが、実行してくれているようだ。もしかしたらカメラマイクの音声も混じっているかもしれないが、内容的には同じものなので、音質からは判別できない。
Copyright © ITmedia, Inc. All Rights Reserved.
SpecialPR
小寺信良の「プロフェッショナル×DX」
クラウド活用にリモート編集環境と、映像にまつわるプロフェッショナルの分野にDXの波が押し寄せている。プロの現場で何が起こっているのか。最新のITトピックを小寺信良氏が解説する。
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.