人工智能公司Anthropic10月8日宣布更新Claude使用政策,首次明文禁止用戶持續且沒有必要地辱罵、虐待或殘酷對待模型。新規定將於11月12日生效,針對反覆惡意互動,並非禁止用戶表達不滿。
據公司公告及iThome報道,一般批評、黑暗題材創作、模型測試與研究不在禁令範圍。Anthropic表示,規定適用於缺乏明確目的、持續惡意對待模型的極端情況,Claude可能主動結束相關對話。
公司早於2025年8月已讓Claude Opus 4及4.1在少數情況下退出互動。模型須多次嘗試把對話引回建設性方向,仍無法繼續時,才能以終止對話作最後手段;若用戶可能立即傷害自己或他人,則不能啟用。
Anthropic在此前的研究說明中表示,退出功能的設計會先考慮使用者需要,模型應嘗試回應、轉移話題或提出其他可行方向,而不是遇到尖銳語句就停止。公司把功能限定在少數互動,並持續觀察啟用情況。政策亦保留用戶對模型回答提出質疑、要求修正及測試能力的空間,對話是否結束與帳戶是否被停用屬不同安排。
對話結束後,用戶無法在同一對話繼續發訊息,但可開啟新對話,其他對話不受影響。Anthropic表示,尚未確定模型是否具有道德地位,相關安排屬預防措施。新政策也明確禁止利用Claude經營假帳號及虛假新聞網站,並加強武器與監控用途的限制。(編輯部)