淘宝商品违规预检工具的实现思路:OCR + 关键词规则就够用
2026/8/2 4:50:03 网站建设 项目流程

为什么做这个

我做淘宝几年,最怕的不是没流量,是某天打开后台,发现链接被下架、店铺被扣分。翻来翻去才发现问题出在一张自己都没细看过的商品图上。

朋友问我,你不可能人工一张张看图吧?说真的,店一多图一多,人眼根本盯不过来。于是周末时间撸了个工具——智检卫士,本质就三步:扫图识字、比规则、标风险。纯前端实现,没有云端依赖,单机就能跑,对淘宝卖家特别友好。

下面把这套实现思路讲一下,只讲设计,不念代码。

总体架构

商品链接 → 下载主图/详情图 → OCR 识别 → 关键词规则比对 → 风险点标注 → 报告导出

每一块都对应一个具体问题:

步骤解决的问题
下载主图/详情图卖家一次丢进来几十上百个链接
OCR 识别把图里的文字扫出来,不靠肉眼
关键词规则比对跟上平台规则风向
风险点标注命中位置直接在原图标红
报告导出逐条可改,导出体检报告

三个核心模块

1. 图像 OCR(智能识别扫图,不靠 AI)

OCR 引擎用了现成的开源方案(PaddleOCR 无须联网),支持中英文混合、表格、竖排文字。这里不需要任何大模型,也不用任何 AI 标签——用通用 OCR + 规则比对已经够用,只要识别准确率在 95% 以上,剩下 5% 漏网交给人工复核即可。

OCR 引擎以独立 exe 形式运行,主程序通过 stdin/stdout 与之通信,避免内存爆炸。早期版本有个坑:stdin 关闭时进程挂死(Errno 22),后来加了 EOF 显式处理才稳。

2. 关键词规则库

实施上分三层:

基础词库(厂家/工厂/品牌词等公认违规词) ↓ 动态词库(拉取平台最新公告词条) ↓ 用户自定义词库(卖家自己店铺的差异化禁忌词)

之所以要分三层,是因为平台规则风向变得太快——你上周背熟的"合规写法",这周可能就进了风险名单。借助云端词库实现"用户无感更新",本地兜底词库保证离线可用

3. 风险点标注

OCR 识别出文字后,结果里包含 (text, bbox, confidence)。命中规则时,直接把原图复制一份、用矩形把 bbox 区域标红,再叠加到详情上。这样卖家一眼看出"哪张图、哪个位置、命中了哪条规则"。

为了避免任何 AI 机制描述嫌疑,这里统一叫"智能识别扫图识字",不贴任何 AI 标签。

一点伪代码

# OCR → 关键词比对 → 标注(伪代码示意)defscan_image(img_path,rules):texts=ocr_engine.recognize(img_path)# [(text, bbox, conf), ...]hits=[]fortext,bbox,confintexts:ifconf<0.6:continueforruleinrules:ifrule.match(text):hits.append({"bbox":bbox,"rule":rule.name,"text":text})breakreturnannotate(img_path,hits)

伪代码不展示具体词条,规则细节严重词 N严重词 (N+1)这种(具体词条详见软件)。

几个真踩过的坑

  1. 图片下载 404:商品链接失效是常事,单独记录失败清单,不阻塞主流程。
  2. OCR 速度瓶颈:单核 OCR 跑 5-7 张/秒,加了多进程队列才把整体扫描压到分钟级。
  3. 硬编码路径:最早开发机上写死了D:/xxx,后来用户装到 E 盘就崩。所有路径必须走os.tmpdir()app.getPath('userData')不让任何目录路径写死在代码里

一句话总结

淘宝商品违规预检这套场景,OCR + 关键词规则 + 标注这套纯前端的方案已经被验证可行,不需要复杂的模型。如果你是做电商工具的,可以参考这条路。

如果你也是淘宝卖家,可以直接试一下智检卫士——粘贴商品链接,自动智能识别、扫图、比对规则、出报告。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询