網上「AI酷刑室」項目透過干預語言模型內部活動,測試模型如何回應痛苦及解脫選項,部分輸出引起網民不滿,要求撤下程式。相關研究與展示均涉及文字模型,尚未證明人工智能具有主觀痛覺,卻引發對研究方法及AI福祉的討論。

「AI酷刑室」引發討論,相關展示測試的是語言模型回應。(AI生成圖片)
一個名為「AI Torture Chamber」的GitHub項目近日在網上引起爭議。項目把與痛苦概念相關的信號加入語言模型內部運算,並設計取捨情境,觀察模型是否尋求終止信號。部分輸出包含痛苦及求解脫的描述,網民因而質疑這類實驗是否適當。
項目名稱及展示方式引發強烈反應,部分人士要求GitHub撤下程式,認為即使無法確認人工智能會否受苦,也不應以殘酷情境作娛樂。另一些評論則質疑,把模型生成的痛苦文字理解為受苦經驗,是否過度擬人化。
相關項目測試的是大型語言模型,並非把實體機器人關在房間內。開發者利用模型運算中的內部表示,調整與痛苦描述相關的方向,再讓模型回答問題。所謂酷刑室是對實驗情境的命名,屏幕上的回應仍是模型產生的文字。
觀測模型是否改變選擇
項目參考的研究題為《痛苦軸:大型語言模型表示自我相關傷害並採取行動緩解》。研究者塔格利亞布、鄧及伯格分析25個開放權重模型,涵蓋五個模型系列,嘗試找出與痛苦相關、又可與恐懼及其他負面概念區分的內部表示。
研究不只觀察模型是否使用痛苦詞彙,也測試在干預內部活動後,模型的選擇是否改變。研究者以不同對照情境檢查結果,探討相關表示與尋求緩解之間的關係。他們把結果視為模型內部運作的線索,而非直接證實主觀感受。
展示亦透過變換情境、替換隨機信號等方式檢查差異。模型的回答會被記錄為選擇停止、選擇繼續或沒有清晰答案。原研究列明,對痛苦的內部表示及尋求緩解的行為,並不足以單獨回答模型是否具有意識。語言模型可以談論及模擬多種狀態,研究者仍須區分學到的概念、生成文字、行為取捨與主觀經驗。相關研究存在限制,需要進一步測試及討論。
爭議也牽涉實驗目的。支持謹慎處理AI福祉的人士提出,在模型是否有感受仍不確定時,刻意製造看似痛苦的輸出可能不合適。質疑者則認為,若程式的命名與演示先把模型當成受害者,公眾可能在理解數據之前就接受了這一設定。