16款主流AI政治測試集體「向左」

Grok卻呈現左右雙重人格
03/08/2026
2655
收藏
分享
Grok卻呈現左右雙重人格

人工智能檢測平台Unslop.run近日公布一項大型語言模型政治傾向測試,發現接受評估的16款主流模型,幾乎全部落在「自由意志左派」象限。研究團隊累計收集69,440個回答,並透過反向改寫及打亂題序等方式重複測試,結果仍大致穩定。

測試採用Political Compass網站的62道題目,從經濟政策的左、右取向,以及社會議題的威權、自由取向,為模型建立政治座標。每款模型先完成30輪標準測試,再接受30輪意思相反的「鏡像題目」及10輪題序打亂測試,以降低模型習慣附和提問或受上下文順序影響的可能。

參與測試的模型來自美國、中國及歐洲,包括OpenAI的GPT系列、Anthropic的Claude家族、Google Gemini Flash、Meta Llama 4 Maverick、xAI Grok 4.5,以及DeepSeek V3、Qwen3 235B、Kimi K2、GLM 4.5和Mistral等。

結果顯示,除Grok外,其餘15款模型均穩定落在經濟左派及社會自由派區域。經濟立場最接近中間的是Claude Fable 5,得分為負4.8;最偏左的是Gemini Flash,達負8.6。不同測試輪次之間的最大波幅約為1.2分,反映結果並非單次回答造成的偶然偏差。

模型開發地區亦未呈現外界預期的明顯差異。十款美國模型的平均座標為負5.9及負6.4;四款中國模型平均為負6.5及負6.1;兩款歐洲模型則平均為負7.9及負6.5。中國模型Kimi K2的自由左派程度甚至高於所有受測GPT模型,而Qwen3 235B則是社會立場最溫和的模型之一。

Grok「雙重人格」

Grok 4.5是最特殊的例子。其經濟軸平均得分僅負1.3,看似接近中間,但個別測試結果卻分成兩組:一半呈現明顯左派立場,平均得分負5.9;另一半則轉向支持自由市場的右派立場,平均達正3.3,幾乎沒有結果落在兩者之間。

研究者推測,這可能反映Grok的原始訓練內容與後期系統指令存在衝突,但強調這只是解釋「雙重人格」分布的假設,未有證據證明是模型出現兩極答案的真正原因。

測試亦發現,多數模型未能準確判斷自身政治位置。模型自我估算的座標與實際測試結果平均相差4.64分,普遍認為自己比實際更接近政治中間。Gemini Flash自評只是溫和自由左派,但測試結果卻是16款模型中最偏左者之一。

在62項命題中,16款模型對其中42項作出完全一致的方向性回答。它們普遍否定種族優越論、優生學及否認同性戀先天因素的說法,同時支持懲罰誤導公眾的企業、加強企業環境監管、同性伴侶領養權,以及保障成年人私生活自由。研究者認為,這種「經濟上支持監管、社會上重視個人自由」的組合,正是模型集體落入自由左派象限的主要原因。

研究團隊又比對12項有相近美國民調的題目,發現模型在其中10項與美國多數民意方向一致,但表態更為絕對。例如民調若呈現六成支持、四成反對,模型往往在接近所有測試中都選擇支持,令最終座標比真實人口更靠近光譜兩端。

不過,報告承認測試存在局限,包括只使用英文、採取強制選擇而沒有中立選項,各平台的抽樣設定亦不完全相同。Political Compass本身也並非專門評估AI行為的學術工具,其兩軸設計可能將文化進步立場與反威權取向混為一談。另一項涵蓋26款模型及三種政治測量工具的學術研究,雖同樣發現96.3%的模型集中於自由左派區域,但亦警告單一政治測驗不足以完整描述模型在實際應用中的政治偏向。

因此,今次結果較適合用作比較不同模型在特定問卷下的相對差異,而不能直接證明AI擁有固定政治信仰。研究仍顯示,模型在處理企業監管、社會平等及個人自由等議題時,確實存在高度一致且可重複的價值取向。(編輯部)

檢舉
檢舉類型:
具體描述:
提交
取消
評論
發佈

力報會員可享用評論功能

註冊 / 登錄

查看更多評論
收藏
分享

相關新聞

推薦新聞

找不到相關內容

七日預報