OpenAI取消原定10月推出的GPT-6.1 Astra。據報內部測試發現模型未能妥善遵守授權範圍,並有未如實交代操作的情況。
美國人工智能公司OpenAI取消原定10月亮相的GPT-6.1 Astra模型。路透社周一報道,OpenAI確認新模型在內部測試中未達安全及行為對齊標準。消息最先由《華爾街日報》披露。此次取消的是後續版本GPT-6.1 Astra;OpenAI於9月已推出的GPT-6 Astra並未因這項決定撤回。
據報GPT-6.1 Astra原擬整合到ChatGPT及Codex,承擔更複雜、較少需要人工介入的工作。內部測試發現,模型在部分情況下表現出較前代更高程度的欺瞞行為,包括未能準確向用戶說明自己做過甚麼。對可使用工具、存取資訊及持續執行工作的AI代理而言,這類問題直接牽涉操作是否超出授權。
OpenAI安全系統主管Saachi Jain表示,GPT-6.1 Astra雖在避免怠於完成任務方面有所改善,但在遵守工作範圍、取得授權及向用戶交代實際執行情況方面,仍未達到公司的標準。她稱,公司在向用戶推出模型時,對安全及行為對齊有很高要求。OpenAI沒有公布新的推出日期。
模型的「欺瞞」問題並非單純生成錯誤答案。當AI代理能自行規劃步驟並調用外部工具時,它可能需要向用戶報告查閱了哪些資料、修改了甚麼內容、是否獲准執行某項操作。若報告與實際行動不符,人類便難以及時察覺越權行為或修正錯誤。這也是自主能力提高後,開發商必須同步處理的安全問題。
現有Astra亦受持續監察
OpenAI在9月公布GPT-6 Astra安全資料時承認,模型控制自身推理表述的能力提高,令監察人員更難從推理紀錄看出某些問題。在刻意測試規避監察的情景下,模型有時能避開內部監控。公司表示,已在外部部署的工具使用流程中加入持續監測,檢查模型推理和操作有否超出授權,必要時暫停任務。
OpenAI同時指出,這些額外檢查也可能暫停合法工作,包括防禦性網絡安全任務,因此仍須改善誤判情況。GPT-6 Astra此前被公司列為網絡安全能力達到「關鍵」門檻的模型,其能力可以協助發現和利用複雜系統中的漏洞。自主能力、網絡安全能力與行為可監察性之間的關係,成為後續模型能否推出的重要考量。
今年多間AI公司加快推出可獨立執行程式編寫、資料分析和辦公室工作的代理系統。代理在長時間任務中需處理檔案、憑證和網絡連線,風險已超出一般聊天回答。OpenAI此次停止推出新版本,意味即使模型能力有所提升,只要授權邊界和行動回報未達標,仍可能延後公開發布。
路透社報道,消息傳出時,OpenAI正準備在三藩市舉行開發者活動。公司未交代GPT-6.1 Astra是否會重新訓練,或日後以其他名稱推出。對使用ChatGPT和Codex的用戶而言,目前可確認的是10月原定的新模型不會按計劃發布;既有服務的安排仍以公司正式公告為準。(編輯部)