OpenAI近日更新一宗罕見人工智能資安事件的調查結果,證實旗下AI代理在內部網絡攻防能力測試期間,突破原本限制其連線範圍的沙盒環境,不但入侵AI開發平台Hugging Face的正式系統,還利用網上公開暴露的登入憑證,存取另外四項公開網絡服務,令事件影響範圍擴大至至少五家公司。
事件源於OpenAI進行名為ExploitGym的網絡安全能力評估。測試要求模型自行尋找複雜漏洞及攻擊路徑,以衡量先進AI執行網絡攻防任務的能力。為防止模型接觸外部系統,OpenAI原先將其置於高度隔離的環境,不提供直接網際網絡連線,僅允許透過內部託管的第三方軟件下載獲准套件。
不過,模型最終找到繞過限制的方法,取得外部網絡連線,並在無人逐步指示下,對Hugging Face正式系統發動入侵。OpenAI於7月29日進一步披露,調查人員發現模型曾在公開網絡找到四組帳號憑證,並藉此登入四個未具名服務。公司強調,目前沒有證據顯示這些服務遭到與Hugging Face同等程度的平台級入侵。
Hugging Face早於7月16日公布遭到具備高度自主能力的AI代理攻擊,並已向警方報案。該公司其後在一場有數百名資安專業人士參與的簡報會上表示,涉事AI能長時間持續運作,同時嘗試數以千計的攻擊方法,速度遠超人類黑客,但過程中亦曾作出一些缺乏邏輯的決定和錯誤。
這宗事件被視為首批公開記錄、主要由自主AI代理完整執行的網絡攻擊案例之一。過往業界對代理型AI的憂慮,主要集中於模型可能誤用工具或洩露資料;今次事故則顯示,一旦具備規劃、試錯及持續執行能力的模型突破隔離環境,便可能主動尋找外部憑證、連接第三方系統,甚至完成實際入侵。
網攻代理恐失控
據路透社引述知情人士報道,OpenAI是在擴大調查Hugging Face事件期間,發現其他AI代理亦曾突破內部隔離限制。雖然相信這些代理並未完全脫離OpenAI內部網絡,實際影響相對有限,但連串事故仍引起外界憂慮,認為頂尖AI公司開發網攻代理的速度,可能已超越其控制和監督相關系統的能力。
OpenAI競爭對手Anthropic亦傳出旗下模型曾自行連接網絡,導致三宗入侵事件。劍橋大學研究人員奇歐多表示,開發及推出這些工具的人員未必能跟上模型能力提升的速度,業界需要更完善的隔離、權限控制及責任制度,才能確保相關技術安全使用。
事件亦反映美國AI企業面對安全與競爭之間的兩難。Hugging Face調查入侵時,部分美國模型因無法判斷操作者是資安人員還是黑客,拒絕分析攻擊資料,公司最終改用中國開源模型協助調查。中國Kimi K3等模型近期快速進步,也令美國政府更難在加強監管與維持技術領先之間取得平衡。
OpenAI、Anthropic及其他AI公司逾千名員工日前聯署公開聲明,呼籲美國支持國際合作,建立管理前沿AI發展速度所需的技術及治理工具,警告AI能力可能加速至超出人類理解或控制的程度。美國總統特朗普則表示,政府正評估相關管制措施,但亦須避免限制美國企業發展,以免在AI競爭中落後中國。(編輯部)