你是否收到过一段看似普通、实则暗藏玄机的文本?它可能来自Claude、Gemini或ChatGPT,表面干净,却悄悄嵌入了不可见的Unicode字符、统计性水印或C2PA元数据——这些“AI指纹”会暴露内容来源,甚至影响隐私与版权归属。watermarks-remover正是为此而生:一个轻量、开源、可审计的Python工具集,专为内容创作者、研究人员和数字隐私倡导者设计,帮你安全、可控地剥离AI生成内容中的各类隐性水印与来源标记,真正拿回对自己作品的完全控制权。
核心功能
- 清除隐形Unicode污染:精准识别并删除零宽空格(ZWSP)、零宽连接符(ZWNJ)、方向控制符(BIDI)、变体选择符等“肉眼不可见”的AI嵌入痕迹,避免复制粘贴后意外泄露来源
- 破解统计水印:针对SynthID(Google)、Kirchenbauer式LLM水印等基于词元采样的概率性标记,提供可配置的文本重写代理(Agent Skill),在保留语义的前提下扰动token分布
- 剥离结构化元数据:深度清理PNG/JPEG中的EXIF、XMP;PDF/DOCX/ODT中的文档属性;SVG/HTML/Markdown中的注释与自定义字段;全面支持C2PA(Content Credentials)标准认证信息
- 多格式统一处理:无需手动转换格式——一套命令即可批量清洗PNG、JPEG、SVG、PDF、DOCX、ODT、HTML、Markdown八类常见内容载体
- 零依赖+纯Python实现:不调用外部API,不上传数据,所有逻辑本地运行;核心模块仅依赖标准库,兼顾安全性与可移植性
- 可扩展的钩子机制:开放
rewrite_text.py等插件接口,开发者可轻松接入自定义重写策略(如适配特定模型水印规则或企业合规要求)
适合哪些人用
这款工具不是为“绕过检测”而设计,而是服务于正当场景下的数字主权需求:内容创作者希望发布纯净文本而不被误判为AI生成;学术研究者需清洗公开数据集以保障实验公平性;企业法务团队要确保对外交付文档不含第三方AI平台元数据;开源作者想将AI辅助产出的代码文档彻底“去品牌化”;以及所有重视数字内容自主权、拒绝被算法悄悄“署名”的技术型用户。
快速上手
只需三步即可开始使用:
- 安装:执行
pip install watermarks-remover(推荐Python 3.9+) - 清理单个文件:例如去除PDF中的C2PA信息,运行
wmr clean --input report.pdf --output clean_report.pdf - 批量净化文本:对Markdown文件执行
wmr strip-unicode README.md,自动剔除所有隐蔽Unicode字符 - 进阶用法:通过
--rewrite参数启用统计水印重写,或查看wmr --help获取完整选项说明
项目还提供预设配置模板与Docker镜像,支持CI/CD流水线集成,适合纳入日常内容发布工作流。
项目信息
Strip multi-vendor AI provenance marks: Unicode text hygiene, statistical rewrite hooks, and C2PA/metadata from PNG/JPEG/SVG/PDF/DOCX/HTML/MD
1.0k
Stars
98
Forks
Python
MIT
编程语言:Python|GitHub Star 数:1037|开源协议:MIT|GitHub 项目地址
它不鼓吹对抗AI检测,而是坚定站在“内容主权”一侧——让你生成的内容,真正只属于你自己。


