研究了半天Claude给文字打水印是什么逻辑
大概是traitor tracing的逻辑。很久之前我在小红书还是微博看过一个案例,有一个姐妹发在朋友圈的自拍被盗图拿去做成小号,她用了一整套排查方式:先是把朋友圈分组,然后在不同分组里,发同一张照片的“隐形水印版”,有的是加了眼影,有的是调了下唇色,总之都是在非常细微的地方,为了让整个行动不引起怀疑,还找了一大堆闺蜜当氛围组点赞🤣直到最后不断缩小范围,揪出了盗图男。
这就是传统的traitor tracing的生活版,其中「朋友圈分组」是最核心的构件,这相当于她心里的一把密钥。比如,分组A对应唇色,而下一次出现的照片正是唇色调改版,那么这个分组里的所有人都命中了。则再把这组人拆分成两组,下一次又命中一组,继续拆分,直到找出盗图男。这个方法实际上没有想象中的耗时,正是因为盗图男每一张图都搬,等于是提供了大量的语料🤣
Claude给文字打水印,技术上可能和Gemini用的SythID Text有所类似,类似灵感也出现在中国数学家苏炜杰的无偏水印法上。Claude生成的文字,也可以在A社的控制下符合某种概率规律,对于用户来说,不同的生成版本不可感,就像是改过眼影和唇色的版本(当然AI 水印还需要满足它始终符合和模仿人类书写的规律,还要反洗文,都是技术难点),但只有A社知道每一次生成时符合那种规律,因此后期检测时可以反过来检查文字符合哪种规律。