视频“去重”为什么越来越没用?从公开的识别原理说起

很多团队仍在用“去重”处理视频:翻转一下、裁一圈、调个色、换段音乐,希望让系统认不出来。

本文不讲任何操作方法,只根据公开的技术资料和平台规则原文,解释这类做法为什么越来越难起作用。

一、什么是“去重”

行业里说的“去重”,通常指不改变视频内容本身,只对已有视频做表层改动,让它看起来像一条新视频。

常见的做法可以概括为以下几类:

  • 画面几何改动:镜像翻转、裁切放大、旋转、改画幅比例。
  • 画面外观改动:加滤镜、调色、加噪点或模糊。
  • 叠加元素:加边框、画中画、贴纸、字幕、水印。
  • 时间改动:变速、抽帧、掐头去尾、打乱片段顺序。
  • 声音改动:改音调、换 BGM、重新配音。

这些改动有一个共同点:画面里拍的是什么、讲的是什么,没有变。

而公开的识别技术,恰恰是朝着“认出内容一样”的方向发展的。

二、公开的识别原理:从“像素一样”到“内容一样”

1. 感知哈希与视频指纹

传统的文件哈希(如 MD5)只要改动一个字节就完全不同,所以早期“改一点就能当新文件”确实成立。

感知哈希则不同:它提取的是人眼感知层面的特征,目标是让“看起来相似”的图片得到相近的哈希值。

Meta(原 Facebook)在 2019 年开源了图片匹配算法 PDQ 和视频匹配算法 TMK+PDQF,官方介绍称它们生成的短哈希可以判断两个文件“相同或相似”。[1]

PDQ 的开源文档说明,它是基于离散余弦变换(DCT)的感知哈希,用来匹配“人们感知为相似”的图片。[2]

TMK+PDQF 的文档说明,它以 PDQ 作为逐帧特征,对加水印、分辨率和压缩变化等轻微改动有一定容忍度。[3]

文档同时写明,TMK 主要面向近乎完整相同的视频,也可以作为更复杂算法的前置筛选。[3]

可见在公开的实践中,多种方法组合使用是常见做法。

2. 学术界已把“去重”手法写进了测试集

学术研究走得更远,已经从“哈希比对”发展到用深度学习提取画面描述符。

2023 年发布的视频相似度数据集与挑战赛(VSC 2023)论文,任务是判断一条视频是否与参考视频共享内容,并定位共享片段的时间位置。[4]

论文列出的查询视频改动方式包括:亮度与色彩调整、灰度化;叠加表情、文字、边框;横向或纵向拼接视频;模糊、加噪、像素化、降低画质;裁切、加边、旋转、翻转、改画幅、缩放;改变播放速度、间隔抽取片段;以及模拟翻拍屏幕、多画面拼成宫格等。[4]

也就是说,常见的“去重”改动,本身就是学术界用来检验识别能力的标准测试项。

此外,CVPR 2022 发表的 VCSL 数据集包含 16 万对真实视频拷贝,标注了超过 28 万对拷贝片段的起止时间,专门研究“片段级”拷贝定位。[5]

3. 音频指纹

声音同样可以被“指纹化”。

Shazam 创始团队 2003 年发表的论文介绍,其算法对噪声和失真有抗性,能在人声和其他强噪声干扰下识别一小段音乐,还能识别被响亮旁白盖住的背景音乐。[6]

ICASSP 2021 的神经音频指纹论文,则在训练中模拟噪声、混响等退化效果来提高鲁棒性。[7]

YouTube 官方帮助页介绍,Content ID 使用版权方提交的音频和视觉参考文件建立数据库,视频上传时会被自动扫描比对。[8]

匹配后,版权方可以选择屏蔽、投放广告获利或追踪观看数据。[8]

4. 画面语义与多模态比对(平台侧为推测)

近年的多模态模型能把画面和文字映射到同一个语义空间。

以 OpenAI 2021 年发表的 CLIP 为例,它用约 4 亿组图文对训练,学习“哪段文字对应哪张图”。[9]

这类技术让“比较两段画面讲的是不是同一件事”在技术上成为可能。

各平台是否、以及如何在搬运识别中使用语义比对,并没有公开细节,以下只是推测:从公开研究的发展方向看,平台完全有条件把画面、声音、文字等多种信号综合起来判断。

5. 文案与字幕的文本比对

文本近似检测是一项成熟技术。

Google 研究人员在 WWW 2007 发表的论文,就专门研究如何在网页抓取中高效识别“近似重复”的页面。[10]

视频里的标题、口播转写和字幕都是文本,只替换几个词、调换语序,文本整体的相似度依然可以被计算出来。

三、平台规则本身就不只看像素

技术之外,更关键的是:平台规则原文已经把很多“去重”手法直接写成了“不算原创”。

  • 微信视频号:《原创声明及相关功能使用须知》把“对原有素材进行简易剪辑拼接,不产生信息增量,比如添加遮挡物、引入转场、缩放拉伸、镜像、倍速播放、添加首尾帧、字幕、边框等”列为不得声明原创的情形。[11]
  • 微信视频号:《运营规范》4.7 条把“以特殊代码、排版、画面设置等技术手段恶意躲避微信系统检测及违规处罚”列为恶意对抗行为。[12]
  • 抖音:《“恶意营销号”治理规范》把“简单裁剪拼接、未经创作加工直接使用,或掐头去尾、替换文案、伪装成‘原创’内容发布”列为抄袭搬运。[13]
  • YouTube:再利用内容政策把“修改音调或速度、其余与原曲相同的歌曲”列为不可获利的例子。[14]

规则还同时看账号和行为。

YouTube 写明,再利用内容政策适用于整个频道,审核人员会查看频道的视频、简介、标题和描述。[14]

据报道,抖音的“账号健康分”依据投稿内容的违规及处罚情况、账号历史行为综合计算。[15]

所以,即使某一条视频暂时没有被识别,账号层面的整体判断依然存在。

四、为什么越来越无效:三个原因

  1. 技术目标变了:识别从“文件是否相同”走向“画面是否相似”,再到“片段是否来自同一来源”,表层改动覆盖的正是研究重点。
  2. 信号变多了:画面、声音、文字各有成熟的比对方法,只改一种信号,其他信号还在。
  3. 规则直接点名:镜像、倍速、缩放、加边框、掐头去尾、改音调,已被平台规则原文列为不算原创或属于搬运。

更根本的一点是:“去重”的出发点是让系统认不出来,而规则关心的是内容有没有“信息增量”。

这两件事不在同一个方向上。

五、结论:差异化必须来自内容本身

与其投入精力研究怎么“改得不像”,不如把精力放在让内容“真的不一样”。

  • 画面:用自己实拍或依法授权的素材,不同成片用不同的画面。
  • 信息:每条内容讲出不同的产品卖点、使用场景或新信息。
  • 表达:不同的脚本、口播和叙事结构。

片多多的主张也是如此:我们不做“去重”,而是用多镜头组合加实拍素材,做出内容上真正不同的成片。

批量生产中怎么做到,见本栏目《从“去重”到“原创组合”》。

参考资料

  1. Meta Newsroom:Open-Sourcing Photo- and Video-Matching Technology(2019-08-01)
  2. GitHub facebook/ThreatExchange:PDQ README
  3. GitHub facebook/ThreatExchange:TMK+PDQF README
  4. Pizzi et al.:The 2023 Video Similarity Dataset and Challenge(arXiv:2306.09489)
  5. VCSL: A Large-scale Video Copy Segment Localization Dataset(CVPR 2022,arXiv:2203.02654)
  6. Avery Li-Chun Wang:An Industrial-Strength Audio Search Algorithm(ISMIR 2003)
  7. Chang et al.:Neural Audio Fingerprint for High-specific Audio Retrieval based on Contrastive Learning(ICASSP 2021)
  8. YouTube Help:How Content ID works
  9. Radford et al.:Learning Transferable Visual Models From Natural Language Supervision(CLIP,arXiv:2103.00020)
  10. Manku, Jain, Das Sarma:Detecting Near-Duplicates for Web Crawling(WWW 2007)
  11. 微信视频号原创声明及相关功能使用须知
  12. 微信视频号运营规范
  13. 杭州网(全文转载):抖音新规!治理“恶意营销号”(2025-04-29)
  14. YouTube Help:YouTube channel monetization policies
  15. 腾讯新闻(IT之家):抖音推出账号健康分机制(2025-04-28)

片多多模板化批量成片系统

想看看你的素材能出多少条?

发一批你们自己的视频素材过来,我们免费出 20 条样片。

能省几个剪辑,拿样片和你自己的工资表算。

免费出 20 条样片 微信:huzi_chang