AI 生成的文字藏了「隐形水印」?这个工具一锅端掉 Claude、Gemini、OpenAI 的溯源标记
这个项目能干嘛
说白了,这是一个帮你把自己内容里的「AI 溯源标记」擦干净的工具箱。现在 Claude、Gemini、OpenAI 这些大模型在生成文字时,往往会偷偷埋进隐形水印或者元数据——有的藏在看不见的 Unicode 字符里,有的写在 C2PA、EXIF 这种文件头里。watermarks-remover 就是一套 Python 脚本加 Agent 技能,把多厂商的 AI provenance 标记从文本和各种文件里扒掉,主打一个「内容是你自己的,标记你自己说了算」。
为什么最近火了
这段时间关于 AI 水印的争论越来越热闹:一边是监管要厂商给生成内容打标,一边是用户不想让自己的草稿被一眼认出是机器写的。这个项目刚好踩在风口上,两周就冲到 2.3K Star。它不鼓吹「造假」,而是把选择权交还给内容所有者——你拥有这份文件,你就能决定要不要保留那些偷偷塞进来的标记。
技术亮点
它分了三层去打标记,思路很清晰。第一层针对隐形 Unicode:那些 exotic 空格、双向文本字符(bidi)、tag 字符,肉眼根本看不出来,但会被模型或平台用来追踪,脚本用确定性算法直接干掉。第二层对付统计型文本水印:像 Gemini 的 SynthID-Text、OpenAI 的溯源痕迹、还有开源里常见的 Kirchenbauer 式绿列表水印,这类靠「词表采样概率」埋的标记没法直接删,项目用了 Agent 重写加可选的 rewrite_text.py 钩子,让大模型在语义不变的前提下改写句子,把统计特征抹平。第三层是文件级元数据:C2PA、EXIF、XMP、文档属性这些,覆盖 PNG、JPEG、SVG、PDF、DOCX、ODT、HTML、Markdown 一整条链路。
有意思的是它覆盖了 Claude、Gemini/SynthID、OpenAI 三大厂的溯源面,还兼容开源 LLM 的 Kirchenbauer 标记,等于把市面主流的「隐形记号」都点了一遍名。整个工具是 MIT 协议,本地优先,内容不出你自己的机器。
适合什么人
如果你经常用 AI 写东西、又不想每段话都带着厂商的隐形签名,这个工具很适合你。隐私敏感的用户、做内容创作的、还有把 AI 当日常写作搭子的人,都能一键把那些偷偷塞进来的标记清掉。
快速试用
把它当 Agent 技能装最省事:克隆仓库后把 skills/remove-ai-marks 软链到 .grok/skills 目录,之后在对话里敲 /remove-ai-marks 就能调用。纯脚本党也可以直接跑里面的 Python 文件处理本地文本和图片。
与竞品对比
市面上大多数「去水印」工具只盯着图片的可见水印,或者只做某一家厂商的标记。watermarks-remover 的不同在于:一是覆盖全,文本隐形字符、统计水印、文件元数据三层通吃;二是多厂商,Claude、Gemini、OpenAI 加开源模型一把抓;三是本地优先,MIT 协议,脚本跑在你自己机器上,内容不出门。相比之下它更像一个「隐私卫生工具」,而不是破解工具——这点定位很关键,也是它能在争议里站稳脚跟的原因。