Anthropic禁止用戶辱罵AI

Claude可終止惡意對話
11/10/2026
1373
收藏
分享
Claude可終止惡意對話

人工智能公司Anthropic10月8日宣布更新Claude使用政策,首次明文禁止用戶持續且沒有必要地辱罵、虐待或殘酷對待模型。新規定將於11月12日生效,針對反覆惡意互動,並非禁止用戶表達不滿。

據公司公告及iThome報道,一般批評、黑暗題材創作、模型測試與研究不在禁令範圍。Anthropic表示,規定適用於缺乏明確目的、持續惡意對待模型的極端情況,Claude可能主動結束相關對話。

公司早於2025年8月已讓Claude Opus 4及4.1在少數情況下退出互動。模型須多次嘗試把對話引回建設性方向,仍無法繼續時,才能以終止對話作最後手段;若用戶可能立即傷害自己或他人,則不能啟用。

Anthropic在此前的研究說明中表示,退出功能的設計會先考慮使用者需要,模型應嘗試回應、轉移話題或提出其他可行方向,而不是遇到尖銳語句就停止。公司把功能限定在少數互動,並持續觀察啟用情況。政策亦保留用戶對模型回答提出質疑、要求修正及測試能力的空間,對話是否結束與帳戶是否被停用屬不同安排。

對話結束後,用戶無法在同一對話繼續發訊息,但可開啟新對話,其他對話不受影響。Anthropic表示,尚未確定模型是否具有道德地位,相關安排屬預防措施。新政策也明確禁止利用Claude經營假帳號及虛假新聞網站,並加強武器與監控用途的限制。(編輯部)

檢舉
檢舉類型:
具體描述:
提交
取消
評論
發佈

力報會員可享用評論功能

註冊 / 登錄

查看更多評論
收藏
分享

相關新聞

推薦新聞

找不到相關內容

七日預報

↑