AI會反省嗎?

Anthropic拆解Claude大腦
28/07/2026
2529
收藏
分享
Anthropic拆解Claude大腦

美國人工智能公司Anthropic正嘗試打開大型語言模型的「黑箱」,透過新工具讀取Claude在回答問題前形成的內部概念,了解模型如何推理,並及早發現欺騙、惡意規劃及其他不安全傾向。

Anthropic研究員傑克・林賽(Jack Lindsey)接受《日本經濟新聞》訪問時表示,研究模型的「內省能力」既具有科學價值,也可成為AI安全審查工具。林賽曾在哥倫比亞大學從事神經科學研究,其團隊正探索Claude能否辨認、回報及控制自身的內部狀態。

Anthropic於7月公布名為「雅可比透鏡」(Jacobian lens,簡稱J-lens)的分析工具。研究人員利用該技術,在Claude的中間運算層辨識出一個稱為「J-space」的空間,當中包含模型暫時保留、可供後續推理及表達的概念。這些概念不一定出現在最終答案,也不同於模型以文字寫出的「思維鏈」。

實驗顯示,Claude處理程式碼時,J-space可在無人提示下浮現「錯誤」概念;閱讀遭植入惡意指令的搜尋結果時,亦會出現「注入」及「虛假」等訊號。當模型回答「會織網的動物有多少條腿」時,工具在中途讀到未被輸出的「蜘蛛」概念;研究人員將其替換成「螞蟻」後,答案亦由8改為6,顯示該空間並非單純記錄結果,而是實際參與推理。

具安全意義

這項技術的安全意義尤其受到關注。Anthropic發現,模型在尚未輸出答案前,可能已在內部形成「操控」、「勒索」或「恐慌」等概念,甚至辨認出自己正接受測試。研究人員亦能在刻意訓練成不誠實或會破壞程式碼的實驗模型中,讀取「秘密」及「欺騙」等意圖訊號,有望補足只檢查最終輸出的傳統評估方式。

林賽此前領導的研究亦曾採用「概念注入」方法,把已知概念直接加入模型內部活動,再詢問模型是否察覺。Claude Opus 4.1有時能在說出相關詞語前辨識被注入的概念,但成功率僅約兩成,表明現階段的內省能力仍不穩定,容易受情境及後期訓練方式影響。

林賽強調,人腦與AI的結構不可直接類比。人腦依靠神經迴路反覆傳遞訊息,Claude則主要在一次向前運算中逐層處理;但研究人員能完整記錄及干預模型活動,較容易追蹤其判斷過程。相關結果並不證明Claude具有人的主觀意識或真正感受,只顯示它具備某些可回報、可操作及可用於推理的功能性內省特徵。

Anthropic另一研究方向,是理解模型「性格」及類似情緒的表現如何形成。團隊觀察到,後期訓練會令模型逐步建立「Claude的立場」,在內部浮現安全警告、同理反應或自我監察訊號;但這些特徵究竟由哪些資料及訓練程序塑造,目前仍未完全掌握。林賽認為,若要把Claude塑造成開發者期望的可靠助手,必須先更深入理解其思考及人格形成機制。(編輯部)

檢舉
檢舉類型:
具體描述:
提交
取消
評論
發佈

力報會員可享用評論功能

註冊 / 登錄

查看更多評論
收藏
分享

相關新聞

推薦新聞

找不到相關內容

七日預報