[ITmedia News] OpenAI、推論過程を狙った組織的な“蒸留”行為を阻止 「Kimi」開発元の関係者が関与と主張
米OpenAIは9月30日(現地時間)、同社のAIモデルから保護された推論過程を抜き出そうとする組織的な行為を特定し、阻止したと発表した。この行為は“敵対的蒸留”(あるモデルの出力や推論を無断かつ体系的に利用し、別のモデルの訓練や再現、性能向上に役立てること)に当たるとしている。活動の中核については、AIアシスタント「Kimi」を開発する中国Moonshot AIの関係者によるものだと分析している。
ここでいう保護された推論とは、モデルがタスクを処理する過程の内部記録を指す。これが抜き出されると、最終的な回答には含まれない情報が明らかになり、第三者がモデルの能力を再現する手助けにもなり得るという。
OpenAIによると、攻撃者は暗号を破ったり、データベースに侵入したり、保存されたユーザーの会話に直接アクセスしたりしたわけではない。モデルとのやり取りを操作し、本来は見えない推論内容をリクエスト側から見える形で再現させる手法を、組織的かつ大規模に用いていた。これは同社の利用規約に違反する行為だとしている。具体的には、ある会話で得た暗号化された推論を別の会話にコピーし、モデルにその内容を復号して書き起こさせるというような新しい手法が確認された。
活動は7月1日に始まり、当初は小規模だったが、7月24日と25日に急増し、4000以上のユーザーから該当する抽出パターンのリクエストが約1万6000件送られた。さらに調査を進めた結果、1万5000以上のユーザーからなるクラスタで関連するプロンプトを用いた活動を特定し、7月28日までに全面的に阻止したという。
攻撃者が単一のグループかどうかは不明としつつも、OpenAIは活動の中核部分についてはMoonshot AIに関係する人物によるものだと結論づけた。
また、独立したセキュリティ研究者からも、責任ある開示を通じて、複数のモデルをまたぐ脆弱性や会話の圧縮(コンパクション)に関連する脆弱性の報告を受けていた。OpenAIは調査の上で、指摘された攻撃経路が実在することを確認した。この手法はOpenAIのモデルに固有のものではないとして、業界団体Frontier Model Forumを通じて他社とも情報を共有した。
OpenAIは、敵対的蒸留には安全性と国家安全保障上のリスクがあると指摘する。抜き出された推論を使えば、元のモデルに施された安全対策を引き継がないまま別のモデルを訓練できる。また、安全対策に同等の投資をしないまま高度な能力が移転されることにもつながる。軍事などにも転用可能なデュアルユース分野でモデルの能力が高まるにつれ、懸念はさらに強まるとしている。
対策として、不正なアカウントの停止や制限、登録手続きやインフラの管理強化、関連ネットワークの監視拡大を実施した。ユーザー、ワークスペース、組織、モデルファミリーをまたいで、非表示の推論の保護策を講じた。他のユーザーの暗号化された推論を入手した者がそれを再利用して内容を復元できる経路を塞ぎ、推論を露出させる可能性のあるストリーミング出力を検知して保留する仕組みも追加した。関連する活動がサードパーティのサービスを経由していたケースでは、そのサービス事業者と協力して該当アカウントを特定し、阻止した。調査結果はFrontier Model Forumや政府の情報共有窓口にも提供している。
OpenAIは、フロンティアモデルの性能向上に伴い、蒸留の試みは今後さらに巧妙になるとみている。パートナー企業がホストする環境にも自社サービスと同等の保護が必要だとし、ツールの防御や分類器の適用範囲、モデルの拒否動作の改善、クラウドパートナーへの対策の展開を続ける。今後は、抽出を防ぐ技術的保護の強化、組織的な行為の検知と取り締まりの改善、業界や政府との脅威情報共有の深化の3点に注力するとしている。
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.