Anthropic生物武器監管失效近一年

1.33億次承包商對話未經安全過濾
17/08/2026
2481
收藏
分享
1.33億次承包商對話未經安全過濾

人工智能公司Anthropic最新安全報告披露,公司用於攔截化學及生物武器相關危險請求的部分安全分類器,曾長時間未能正常運作,導致2025年5月至2026年4月期間,外部承包商與模型進行的大量對話未經相關安全機制過濾。Anthropic表示,內部調查暫未發現這些請求被實際用於惡意用途的證據。

Anthropic近日發布報告指出,問題主要涉及負責提供人工回饋的外部承包商。約5萬名承包商在相關期間合共產生約1.33億次模型對話,但這些流量接近一年時間沒有經過公司原定的生物安全分類器檢查。

按照Anthropic公布的安全架構,系統會透過即時提示詞及輸出分類器,分析用戶輸入及模型生成內容,一旦識別到可能涉及化學、生物、放射性及核武器(CBRN)等高風險資訊,便會阻止模型提供可能協助實施危險行為的內容。相關分類器是公司多層AI安全防護的重要組成部分。

Anthropic表示,今次問題源於外部承包商的安全篩查及管理流程存在不足。這批承包商主要由第三方供應商管理,公司其後展開內部調查,目前未發現相關未過濾請求被用作實際濫用,但已根據調查結果提高對外部供應商及承包商的安全要求,加強篩查及監督。

事實上,Anthropic近年持續把生物及化學風險列為大型模型安全工作的重點。公司在2025年5月推出Claude Opus 4時,已啟用人工智能安全等級3(ASL-3)防護措施,針對模型可能協助開發或取得化學、生物、放射性及核武器的風險實施額外部署限制。

根據Anthropic現行「負責任擴展政策」,相關即時分類器會持續監察模型輸入及輸出,並因應新出現的有害模式、越獄方法及內容混淆技術更新規則。除自動分類器外,公司亦利用紅隊測試、漏洞賞金計劃及離線監測等方式,形成多層防禦機制。

Anthropic今年7月公布Claude Fable 5的安全措施時,再度把生物及化學領域列為高風險範疇。公司認為,隨着模型能力提升,其底層能力在部分情境下可能為惡意行為者提供額外協助,因此需要限制特定高風險請求。

不過,Anthropic亦承認,過於嚴格的安全分類器可能誤判正常科研用途。目前Fable 5接收到的部分生物及化學相關請求,會轉交Claude Opus 4.8處理,以降低風險。公司表示,未來隨着分類及防護機制進一步改善,將逐步縮小相關限制範圍,在降低安全風險與維持合法科研用途之間取得平衡。

此次事件亦反映,AI公司的安全防護不僅取決於模型本身,外部承包商、資料標註及人工回饋流程同樣可能成為安全管理的薄弱環節。Anthropic表示,已根據調查結果收緊相關管理制度,並將持續調整涉及化學、生物武器等高風險領域的安全標準。(編輯部)

檢舉
檢舉類型:
具體描述:
提交
取消
評論
發佈

力報會員可享用評論功能

註冊 / 登錄

查看更多評論
收藏
分享

相關新聞

推薦新聞

找不到相關內容

七日預報