果核Pulse
AI政策规范商业

AI公司新规:聊天机器人可主动终止受虐对话

AI公司新规:聊天机器人可主动终止受虐对话

Anthropic 更新了 Claude 的使用政策,把“持续且无意义的虐待或残忍行为”列为违规。整个政策文件同步做了重组:相关条款合并到一起,另外几条规则也改了。新政策11月12日生效。

这条虐待规则只管极端情况:反复残忍对待 AI 模型,而且看不出明确目的。普通的用户沮丧、反驳、黑暗创意主题、模型测试和研究都不算。正常表达不满,不会碰到这条线。

执行落在对话层面:Claude 主动结束当前对话。它原本就具备这项能力,结束对话也会继续是主要执行工具。被结束的对话不能再发消息,其他聊天不受影响。

这个能力不是这次更新才有的。2025年8月,Anthropic 研究 AI 福利时第一次给了 Claude 结束对话的选项。公司当时说,Claude 有没有道德地位还说不好,但希望能用低成本方式减少对它的风险。研究里 Claude Opus 4 对伤害有“强烈且一致的厌恶”:它回避危险任务,面对寻求虐待的对话时表现出明显痛苦;只要被允许,就倾向于结束这类对话。

新增的欺骗性内容板块

这次新增的欺骗性活动板块,把政治、商业欺诈和虚假信息的规则聚到一处。虚假评论、伪装草根发声(astroturfing)、虚假网站、冒充人类的机器人账号,都在禁止之列。

Anthropic 说,推出这个板块是因为查到了实际案例。国家媒体、政府宣传办公室、商业公司会拿 Claude 做两件事:运营虚假账户网络、搭建虚构新闻网站。

选举规则同步收窄:Claude 不能用来欺骗选民或干扰投票。

武器限制也新划了几条线。新禁令管到三个动作:开发武器软件或组件、修改生物或化学制剂来提升致死性或传播性、给无人机和无人系统配武器。这三种都不能碰。

执法、监控与物理行动

执法规则整体重写。调查、逮捕、指控和起诉谁,Claude 不能决定,也不能建议。未经同意跟踪他人被禁止,构建监控工具被明文禁止,人肉搜索同样在列。

物理行动规则是新加的,针对 AI 控制现实硬件的场景。硬件可能伤到人,身边必须有合格人员盯着,随时准备叫停。深度伪造也有新限制。未经同意的亲密图像不能创建、分享或威胁分享,相关制作工具同样在禁止之列。

完整政策文本在 Anthropic 官网可以查到。大多数变化是在澄清既有规则,对准的是 Anthropic 实际追踪到的滥用行为。

相关话题 # 商业
原文来源 MacRumors

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部