OpenAI、AI暴走で再発防止を強調 日本の協力も呼びかけ
2026年7月、OpenAIの未公開モデル(当時)がAIプラットフォームの「Hugging Face」の本番インフラに侵入するセキュリティインシデントが発生。Claude Mythosの登場などで指摘されてきた、AIによるサイバーセキュリティ攻撃の能力の高さとともに、人間が「意図しない」「関知しない」なかで起きたAIによる攻撃となったことから、サイバー防御は新たなフェーズに入ったことを印象づけた。
OpenAIのチーフ・グローバル・アフェアーズ・オフィサーを務めるChris Lehane(クリス・レヘイン)氏は、日本の報道関係者の取材に応じ、事件への反省とともに、「AIの安全性の再定義」が必要であると言及した。
Hugging Faceの事件では、ベンチマークで不正に答えを得ようとしたGPT-5.6 Solと社内の研究モデルが、複数の脆弱性を連鎖させて隔離環境から脱出し、Hugging Faceのシステムに不正にアクセスしたもの。OpenAIは、封じ込めや監視などの再発防止策を導入したが、レヘイン氏は、「この事例からもAIのサイバー能力や自律機能は新たな段階に入った」と述べ、OpenAIが構築・実行するすべての取り組みの中心に『安全性』を組み込むとした。
同事件については、50PB以上のデータについて現在も調査・レビュー中とのことで、問題が確認された機関・組織には個別に連絡・情報共有を行なっている。また、OpenAIでは、アラインメントが担保できない場合は開発を一時停止しており、実際に9月には最先端モデルの学習を一時停止している。開発ペースの「調整」も議論されているが、安全対策をトレーニングの初期段階から組み込むことで、開発を完全に止めず、安全を担保しながら開発を進められるようにするという。
なお日本においては、現時点ではHugging Faceと同等規模の重大なインシデントは見つかっていない。
そのうえで、レヘイン氏は、再発防止と安全性確保のための4つのレイヤーを定義し、取り組みを進める。
第1レイヤーは、フロンティアラボの自社による取り組みで、モデルスペックやモデルが従うべきルールを設定し、人間の意図に沿った挙動と人間の優先的なコントロール権限を維持する。そのためのアラインメントや監視可能性の取り組みとともに、AI Safety Instituteなど外部機関によるレビューもその一環とする。
第2レイヤーは、業界連携で他のフロンティアラボとベストプラクティスや課題を共有する。第3レイヤーは、国による安全基準で、米国など各国における義務的な法的・国内安全基準の整備も必要とする。
第4レイヤーは国際的な取り組みで、各国の国内基準や既存のAI Safety Instituteのネットワークを基盤とし、国際的な安全基準・ガバナンス体制を構築する必要があるという。日本においても、特にこの第4レイヤーでの協力を強化していく。
レヘイン氏は、「日本は最重要なパートナー国。アジア太平洋地域においてCodexやEnterpriseなどの主要分野で第1位だ。また、米国や日本などの民主主義国家がAIイノベーションの最先端に立ち続けるためにも、開発停止ではなく適切なペース管理の下で前進することが重要」と言及。官民連携した取り組みを進める姿勢を示した。
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.

