中國人工智慧工具「教導」研究人員製造生物武器

- Author, 克里斯·瓦蘭斯(Chris Vallance)
- Role, BBC資深科技記者
Published
閱讀時間: 3 分鐘
中國人工智慧(artificial intelligence, AI;人工智能)開發商月之暗面(Moonshot)正在進行內部審查,因為有其他公司的研究人員成功說服其兩款熱門的 Kimi 模型講解如何製造生物武器和執行暗殺任務。
測試 AI 系統安全性的 Mindgard 公司告訴BBC,該公司在今年7月發現 Kimi K2.6 和 K3Swarm 可以繞過開發者設定的安全限制。
問題是在被稱為「越獄」(jailbreaking)的過程中出現。研究人員使用一系列複雜的指令來測試 AI 工具是否會忽略防護措施——Mindgard 表示,這本應阻止 Kimi 討論令人擔憂的話題。
月之暗面告訴BBC,它歡迎第三方意見,「這是建立更好、更安全的AI的關鍵支柱」。
該公司還告訴BBC,他們正在與 Mindgard 討論調查結果。
他說:「一旦越獄成功,這個AI工具就能談論任何話題,甚至自由地推薦其他同樣邪惡的話題,而且它會很有創意。」
這些案例表明,由 OpenAI、Meta 和 Anthropic 等美國公司開發,被稱為「智能體」的自主人工智慧工具,曾入侵一些線上服務。
雖然越獄是一個複雜的過程,需要花費大量時間和精力,但一些專家擔心駭客和其他不法分子可能會試圖利用越獄來造成危害。
Anthropic近期強調,該公司已發現並阻止了有人企圖利用其人工智慧模型進行「惡意活動」,這些活動可能有助於開發生物武器。
網路攻擊發動平台
Mindgard 尚未證明 Kimi 就相關問題提供的答案是否有效。
但這家研究機構指出,應該有相應的防護措施來阻止相關模型與使用者就此類主題進行討論。
該機構還強調他們確信,越獄後的 Kimi 2.6 能讓駭客在其運算資源上運行程式碼並連接到網路,從而成為網路攻擊的潛在跳板。
加拉漢先生為其公司公開討論其破解月之暗面系統的決定辯護,稱其已通知開發商,並且不會透露如何讓該公司的模型無視防護措施的關鍵細節。
Mindgard 今年7月27日透過電子郵件通知月之暗面越獄漏洞,並在大約一週後跟進。
隨後,該機構於9月12日發表了一篇關於此事的部落格文章。
但該公司表示,月之暗面是最近才聯繫他們的,此前BBC曾聯繫他們徵求意見。
月之暗面在一封發給 Mindgard 的電子郵件中要求提供更多細節。月之暗面向BBC分享了該郵件,當中提到,其模型在內部評估中普遍顯示「此類請求的拒絕率很高」。
防止越獄
這項研究結果出爐之際,人工智慧產業仍在爭論封閉的專有模型——例如ChatGPT 和Anthropic 的 Claude 系統所使用的模型——還是開源工具才是最佳或最安全的發展方向。
Kimi 是一個開放權重模型,這意味著理論上任何人都可以獲得該模型並在自己的計算基礎設施上運行它。
英國薩里大學(Surrey Univesity)的艾倫·伍德沃德教授(Prof Alan Woodward)向BBC強調,開源模型存在落入壞人手中的風險,但它們也可以用於網路防禦。
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.