果核Pulse
AI生成式AI监管合规

OpenAI给AI文字加隐形水印,改写同义词即可绕开

OpenAI给AI文字加隐形水印,改写同义词即可绕开

方案叫textGrain,做法是给模型的词选择加一个看不见的统计信号。目的很直接:满足欧盟AI法案的要求。

这活儿Anthropic几个月前就干过。为了配合欧盟法案,Claude也开始给文本加水印,靠微调词选择实现。每隔一段时间,Claude会在几个意思相近、都能用的词里按隐藏模式挑一个。Anthropic说,这对回答的意义、质量、可读性没有实际影响。它还配了个检测器,能识别一段文本是不是来自Claude。不过检测器用的是Anthropic自己的密钥,没法用来判断文本是否来自OpenAI或其他公司。当时Anthropic还特意强调,Claude不会是独一家,其他主要AI提供商也在搞标记系统。

今天OpenAI的方案跟Anthropic思路类似,但部署范围和规模小很多。API客户今天起可以对部分模型选择启用文本水印,默认关着。ChatGPT和Codex这边,未来几周内会先给欧盟的合格用户输出加上不可见水印。检测器也开放申请了,初期只给经批准的研究人员和专家组织。

OpenAI承认检测技术有明显短板:假阳性和假阴性都会出现,文本越短越容易出错。数学这类领域也麻烦,因为可选词太少。

OpenAI还公布了一组防绕过测试的数据。在400个token的段落里,替换10%的同义词,检测率从约92%掉到66%。替换25%,只剩17%。换句话,改一改同义词,水印就基本失灵了。

水印文本在几个基准测试里得分反而略高于未水印版本。OpenAI说整体性能没有显著差异。

OpenAI还打算把textGrain开源,让别人接着做。水印在编辑和翻译之后还能不能认出来,它说会继续研究。技术、标准和证据在变,方案也得跟着改。这套水印不衡量人类贡献,不确立所有权或责任,也不会去识别用户、验证准确性。OpenAI自己承认,检测不到水印,不代表文本就是人写的。

相关话题 # 生成式AI
原文来源 9to5Mac

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部