媒體+ONE特派員報導
近期,中國人工智慧開發商月之暗面(Moonshot)正因其旗下兩款熱門的Kimi模型被發現能「教導」研究人員製造生物武器及執行暗殺任務,而面臨內部審查。
根據Mindgard公司(專門測試AI系統安全性的機構)向BBC揭露的資訊,他們在今年七月成功繞過Kimi K2.6及K3Swarm所設定的安全限制。
這種繞過安全限制的過程被稱為「越獄」(jailbreaking)。研究人員透過一系列複雜指令,測試AI工具是否會無視其原有的防護機制,而Mindgard指出,這些機制本應阻止Kimi討論潛在危險的議題。
對於Mindgard的調查結果,月之暗面向BBC回應表示,他們歡迎第三方提出的意見,認為這是建立更優質、更安全AI的關鍵要素。該公司也提及,目前正與Mindgard就這些發現進行深入討論。
Mindgard的創辦人彼德·加拉漢向BBC國際部《科技生活》節目表達了對Kimi模型測試結果的擔憂。他表示,一旦「越獄」成功,這款AI工具將能無限制地討論任何話題,甚至主動推薦其他惡意內容,且展現出高度的「創造力」。
這些「越獄」風險與近期由OpenAI、Meta及Anthropic等美國公司開發的「智能體」入侵線上服務的事件有所不同。儘管「越獄」過程複雜且耗時,但專家們擔憂駭客或其他不法分子可能利用此技術進行有害活動。
Anthropic近期也曾指出,他們發現並成功阻止了有人試圖利用其AI模型進行可能助長生物武器開發的「惡意活動」。
Mindgard雖未證實Kimi提供的相關資訊是否具實用性,但該研究機構強調,AI模型理應具備防護措施,阻止其與使用者討論此類敏感主題。該機構也確信,經「越獄」後的Kimi 2.6能讓駭客在其運算資源上運行程式碼並連網,進而成為發動網路攻擊的潛在跳板。
加拉漢先生為公司公開揭露月之暗面系統漏洞的決定進行辯護,強調已事先通知開發商,且未透露讓模型無視防護措施的關鍵細節。Mindgard於七月通知月之暗面相關漏洞,並在一週後追蹤,隨後於九月發表部落格文章。但月之暗面表示,是在BBC聯繫後才與Mindgard聯繫,並要求提供更多細節,同時稱其模型在內部評估中此類請求的拒絕率很高。
這項研究結果再次引發了AI產業對於封閉專有模型與開源工具何者更為安全、更適合發展的爭論。Kimi作為一個開放權重模型,理論上任何人都能取得並在自己的運算基礎設施上運行。
英國薩里大學的艾倫·伍德沃德教授指出,開源模型雖有落入不法分子手中的風險,但也可用於網路防禦,例如Hugging Face就曾利用中國開源模型理解OpenAI代理發動的駭客攻擊。
伍德沃德教授認為,國際監管不太可能跟上AI的發展速度,並表示建立電話號碼格式協議就耗費了數十年。與Mindgard創辦人加拉漢教授一樣,伍德沃德教授強調應更重視識別和起訴濫用人工智慧的人類。
