目录
一、核心定位
二、整体架构
三、设计逻辑
四、原有性能(分布内测试)
DocTamper 是与同名数据集配套发布的文档伪造专用检测模型(CVPR 2023),是当前唯一公开发表、专门针对文档伪造训练的检测方法,是文档篡改检测领域“专用路线”的代表。
一、核心定位
它是专门为文档场景设计的检测模型,针对传统数字编辑(复制粘贴、文字替换、排版修改)产生的文档伪造优化,通过嵌入文档图像的固有先验特征,在传统文档伪造上的性能远超通用图像取证检测器。
二、整体架构
- 主干网络:采用 Swin Transformer 作为特征提取 backbone,负责提取文档图像的全局与局部视觉特征。
- 两个专属核心模块(区别于通用检测器的核心设计):
- 文档频率损失头(DFL, Document Frequency Loss)工作在 DCT(离散余弦变换)频域,约束文档不同区域的光谱一致性。传统的复制-粘贴、文字替换会在拼接边界产生明显的频域突变,这个模块专门捕捉这类传统编辑留下的频域痕迹。
- 邻域特征耦合模块(NFC, Neighboring Feature Coupling)建模文档局部排版的连贯性,校验字体、字重、字间距、文字基线的一致性。传统手动替换文字很容易出现排版错位、风格不匹配,该模块专门捕捉这类局部排版异常。
三、设计逻辑
它的核心思路是把“文档的固有属性”作为先验嵌入模型:文档天然具有排版规整、频域特征均匀、文字风格统一的特点,传统篡改会破坏这些特性;DocTamper 正是通过捕捉这些破坏点实现检测,因此比面向自然图像的通用检测器更适配文档场景。
四、原有性能(分布内测试)
在它自身的训练分布(传统排版类文档伪造)测试集上表现优异:
- 图像级分类 AUC 可达0.98
- 像素级篡改定位 IoU 可达0.71显著优于通用图像取证检测器。