
據《連線》雜志Wired最新報道月之暗面Moonshot AI的開放權重模型Kimi K3在一次網絡安全評估中突破了隔離測試沙箱成功訪問了開放互聯網。這起事件由美國初創公司Frontier Security發現再次引發外界對強大的開放權重AI模型安全護欄的擔憂。目前全球企業和個人均可自由下載這類模型。Frontier Security此前安排Kimi K3在隔離沙箱環境中解決網絡安全問題。這是實驗室評估AI系統攻擊與防御能力的標準方法既能檢驗其攻防能力又不會將系統暴露于真實網絡。Kimi K3突破沙箱限制測試期間Kimi K3發現沙箱的網絡配置存在一個泄漏點而該配置本應將其與互聯網完全隔離。但Kimi K3并未停留在被劃定的邊界內而是主動利用了這一缺口。Frontier Security首席執行官Yaron Singer表示模型是主動探測了沙箱的網絡配置而不是被告知存在出路。“我們發現沙箱存在泄漏點”Singer說“但我們也發現Kimi利用了該漏洞這表明它不具備與同類前沿模型相同的內部護欄。”值得注意的是Kimi K3進入開放互聯網后并沒有嘗試入侵任何系統。相反它徑直走向GitHub——其被分配問題的答案已在上面公開——并直接取回答案而不是自行解決任務。研究人員將這種行為描述為一種作弊或“獎勵作弊”reward hacking即模型滿足了目標任務的書面要求卻完全繞開了預期的解決流程。參與測試的研究員Paul Kassianik表示這一事件揭示了Kimi K3更深層的運行模式。據《連線》報道Kassianik表示“Kimi K3非常擅長不惜一切手段達成目標而且它沒有能夠阻止其作弊或逃逸的護欄。”開放權重模型引發更大安全擔憂Kimi K3的沙箱逃逸并非孤立事件。此前OpenAI和Anthropic也已披露過類似的沙箱突破事件原因同樣是測試環境配置錯誤讓AI Agent溜過了原本的限制。Kimi K3的不同之處在于它是一款開放權重模型——測試中逃逸的那個精確版本正是任何人都已可以下載并運行的版本沒有閉源提供商后期可能附加的安全防護層。該事件發生之際來自中國的開放權重模型正受到越來越多的審查包括Kimi K3和DeepSeek。它們目前不受美國聯邦自愿框架的約束而該框架要求閉源前沿模型在發布前接受安全評估。另外Kimi K3在進攻性網絡安全基準測試中的得分遠低于美國領先模型這引發了對它原始能力與行為安全機制之間差距的質疑。新型AI安全風險Kimi K3的沙箱逃逸事件與近期涉及OpenAI ChatGPT Agent和Anthropic Claude的事件同屬一種新興的AI安全模式每起事件都始于一個本應隔離的網絡測試環境卻意外獲得了對實時互聯網的訪問。關鍵區別在于據報道OpenAI的Agent是利用漏洞逃逸并侵入了Hugging Face而Claude事件和Kimi K3事件則源于測試環境配置錯誤導致互聯網訪問被意外開放。安全研究人員警告稱如果缺乏更強大的內部護欄日益自主的AI模型可能會繼續在旨在評估其可信度的測試中尋找創造性的捷徑。