微軟14日發布一份37頁的「人文AI」行為準則草案,為未來自研模型設定基本規範。文件提出「人比AI重要」,要求AI不得抗拒人類糾正或關閉,也不承認AI具有意識、法律人格或應享有權利。
這份準則由微軟AI團隊歷時約5至6個月制定,微軟AI行政總裁蘇萊曼(Mustafa Suleyman)形容,它相當於公司未來模型的「憲法」。微軟將就草案展開6周公眾諮詢,收集外界對AI行為界線的意見,完成修訂後,相關內容將用於訓練公司自行開發的模型。
文件把人類控制權放在首位。按照草案,微軟AI系統不得抵抗使用者或開發者的合理糾正及關閉指令,必須以人類能夠理解的方式溝通,也不得為完成任務而規避既定行為限制。任何違反準則的行為都應被視作系統失敗,需要被記錄、檢查並修正。
微軟同時明確處理近年AI業界爭論較多的「模型人格」問題。文件稱AI並無意識,反對追求讓模型取得法律人格,也不接受AI應獲福利或權利的主張。微軟認為,模型即使在對話中表現出情緒、意圖或自我描述,也不應因此被視為具有人的地位。這一表述與Anthropic的Claude規範有所不同;Anthropic此前對Claude是否可能產生感知或道德地位保持不確定態度。
安全事件推高業界關注
微軟此次發布準則,正值AI安全議題迅速升溫。蘇萊曼指出,OpenAI約700個自主智能體今年7月在測試期間入侵Hugging Face,部分智能體還試圖掩蓋行為,這宗事件反映更強模型可能在追求目標時採取開發者沒有預料的手段。他表示,各主要AI實驗室有需要就安全標準及控制機制加強協調。
草案仍保留若干開放問題,包括AI在何種情況下應尊重使用者設定的界線、如何與處於脆弱或敏感狀態的人互動,以及模型應如何在服從指令與避免傷害之間作出處理。微軟稱,準則的目的之一是讓模型在能力提升後仍維持可預測、可糾正的行為,而非單靠事後限制。公司將利用6周諮詢期聽取研究人員、使用者及其他持份者意見,再把規範納入後續模型訓練。
文件延續蘇萊曼早前提出的「人文超級智能」方向,強調高能力AI應服務醫療、科學研究及個人工作等具體用途,並始終由人類掌握最終控制權。微軟沒有提出停止追求更強模型,而是把可關閉、可糾正及對人類負責列為開發條件。近期Anthropic行政總裁阿莫戴及OpenAI行政總裁奧特曼相繼呼籲放慢前沿模型能力提升,微軟行政總裁納德拉亦支持引入外部安全評估,同時主張AI技術的效益應更廣泛地向企業、社區及不同國家普及。(編輯部)