Anthropic研究員Jacob Coxon公開辭職,警告大型人工智能公司正競逐可自我改進的超級智能,若缺乏有效控制,未來10年可能帶來人類滅絕風險。文章迅速在科技界和政界流傳,把多年來較局限於研究圈的「AI末日論」推向主流討論。

Anthropic研究員JacobCoxon辭職並警告AI失控風險。(AI生成圖片)
Coxon曾在OpenAI及Anthropic從事模型預訓練工作。他表示,前沿模型能力提升速度超出社會治理準備,而企業在商業和競爭壓力下難以自行放慢。他擔心具自主規劃、編程和研究能力的系統,可能逃避人類監督,協助網絡攻擊或生物武器開發。
他沒有聲稱已存在會消滅人類的模型,也沒有提出「10年內必然死亡」的可驗證預測。文章反映的是對低概率、高衝擊風險的判斷。Anthropic對外一直把AI安全列為研究重點,但同時擴大模型、算力和商業部署,這種雙重角色受到批評者關注。
爭議升溫後,Anthropic對齊科學負責人Evan Hubinger表示,他估計未來10年AI導致人類滅絕的風險超過10%。英國超過70名議員和上議院成員亦要求政府支持禁止開發人工超級智能,並推動國際協議。
風險判斷差距極大
支持加強管制者認為,即使滅絕機率不能精確計算,後果過於嚴重,政府仍應要求前沿模型接受獨立測試、事故通報和部署限制。現有安全承諾多由企業自願制定,缺少統一的審核權和法律責任。
反對末日敘事的人則指出,超級智能仍屬假設,現有模型會犯錯、依賴人類提供算力和工具,也沒有獨立控制全球基礎設施。把注意力集中在人類滅絕,可能忽略已經出現的歧視、詐騙、失業、版權和權力集中問題。
Hugging Face行政總裁Clément Delangue表示,評估AI滅絕風險不能只依賴個別模型工程師,並以請冷氣技師評論氣候變化作比喻。他其後澄清不是否定Coxon經驗,而是認為公共政策需要更廣泛專業證據。
現時主要治理方案包括禁止超級智能、建立牌照及監管機構,以及以法律責任約束開發商。禁止方案界定困難,因為「超級智能」沒有共同測量標準;牌照制度可能提高透明度,但也可能鞏固大型公司;責任制度則要證明模型、部署者和使用者之間的因果關係。
美國聯邦層面的全面AI安全法仍有限,加州等地則推進前沿模型披露及事故規則。英國政府表示正研究針對重大安全風險的措施,但未支持全面禁止。各國又擔心單方面放慢會在與中國及其他地區競爭中失去優勢。