本文整理自 QCon 北京 2026 董正心分享《AI大模型重塑垂域任务:淘宝闪购搜推商品理解的全新建模》,通过AI音视频总结工具Ai好记进行转录整理,以下为视频转文字整理后的会议笔记内容。
通用大模型很强,可一旦落到具体的垂域业务上,事情往往没那么简单。
淘宝闪购搜推算法团队在做商品内容理解时,就遇到了知识遗忘、数据稀缺、泛化不足、多任务孤岛一系列问题。
这篇文章把他们的完整建模思路拆开讲:从背景、任务,到统一训练范式、多模态训练,再到大模型质检飞轮,整个过程对做搜推、做 NLP 落地、甚至搭 AI 知识库的人都很有参考价值。
为什么要做商品内容理解
用户打开外卖或即时零售 App,输入想吃的菜,平台得准确理解需求,推荐最心仪的商品。
这个流程看着简单,背后是四个能力在支撑:提升搜索体验、精准个性化推荐、优化商品展示、平台治理与风控。
在整个搜推系统里,内容理解包含两个核心模块:Query理解在入口侧搞懂用户想什么,商品理解在商品侧搞懂商品是什么。
两者像左右大脑,共同作用于召回层和排序层。垂域大模型就是连接用户意图和商品信息的桥梁。
三个核心垂域任务
淘宝闪购的垂域任务里,三个最典型。
类目预测:根据商品信息,在庞大的树状类目体系里找到最合适的叶子节点。
难点在于同一个商品不同商家描述差异很大,模型要有强语义理解。类目错了会连带筛选器失效、推荐不准、搜索不相关,直接拉低转化率。
工程上常用前置分类器筛出 top5 候选类目再让大模型做选择题,或者用多轮对话逐级细化。
CPV预测:识别并结构化商品的关键特征。难点有三,实体边界破碎、需要推理的复杂语义、以及新属性泛化。经典做法是 LLM 加 RAG,检索外部知识库补充商品属性背景知识。
卖点生成:提炼商品核心价值,比如一件T恤生成「纯棉透气,简约大方」,本质利用大模型的语言生成能力。
传统模型做这些任务,暴露四个局限:垂域微调导致灾难性遗忘、高度依赖高质量标注数据、新商品新描述泛化不足、各任务独立训练形成多任务孤岛。
这逼着团队去设计一套统一训练范式。
统一垂域训练范式
核心思路是构建 FodInstruct 数据集,覆盖外卖领域 12 个 NLP 任务,总量超 160 万条指令数据,来源是历年人工标注和大模型合成。
训练上提出两阶段 Post-Training 框架。
阶段一领域多任务后训练,融合 12 个任务做 SFT、DPO、PPO 三步。SFT 先打底,再用预测错误数据构造偏好三元组训练 Reward Model 和 PPO。阶段二在每个垂域任务上微调。这套工作发在了 KDD25 ADSTrack。
实验结果很实在:12 个任务里 9 个有提升,最大单任务增益 4%,训练迭代从 5 轮减到 2 轮,训练数据需求降了 40%。
三个经验值得记:
- DPO 的价值主要在有监督语料上
- PPO 的价值在大量无监督商品数据上
- PPO 用 DPO 模型初始化能省步骤省迭代
垂域多模态训练
商品图片信息量大,通用多模态大模型只描述视觉细节,给不出品牌、口味、净含量、包装规格这些电商关心的关键信息。
问题出在三点:缺垂域知识、细粒度识别精度不足、任务导向能力弱。
解决方案是先建垂域多模态数据,分 Caption 和 VQA 两类混合训练。数据生成上设计了多种方法:两阶段生成先出属性再出描述、基于算法图谱生成、针对套餐商品的种子问题池方案、Self-Instruct 自我问答、从简单到复杂的细粒度感知和认知推理演进,以及 CoT 迭代生成。
训练分三个阶段,重点是领域指令对齐做全参 SFT。
几个消融结论有意思:全参训练比 LoRA 在垂域理解上更强,数据量少时增大 LoRA 秩反而下降,更小的多模态模型居然比更大的纯文本模型效果好,多模态预训练把能力迁移到了纯文本任务上。
最佳数据配比是垂域任务数据占 35%,只用原来 50% 的数据就接近全量效果。
大模型标注与质检飞轮
数据质量怎么保证?
团队建了个自我强化的闭环:大模型数据生成(多 SOTA 模型投票)到低置信数据人工复核,再到反馈训练,最后大模型质检。
这个飞轮大大降低了标注人力依赖,因为从 90% 到 95% 是质变,95% 到 98% 又是个难跨的鸿沟,低置信数据往往是跨越鸿沟的关键。
总结
淘宝闪购这套方案的核心是把多个垂域任务统一进一套后训练框架里,用多模态数据补垂域知识,再用数据飞轮保证质量。对普通开发者来说,这套思路同样适用于构建 AI 知识库或音视频内容理解系统。
常见问题 FAQ
问:垂域大模型微调总是遗忘通用能力怎么办?
答:用两阶段后训练框架,先做领域多任务统一后训练打底,再分任务微调,能显著缓解灾难性遗忘,还能省数据省迭代。
问:商品类目预测为什么先用分类器筛 top5 再让大模型选?
答:类目体系太大,全部塞进 Prompt 会导致上下文过长、推理变慢。前置分类器把候选压到 top5,兼顾准确和效率。
问:电商场景多模态数据从哪来?
答:靠 Caption 和 VQA 数据混合训练,用算法图谱、两阶段生成、Self-Instruct 等方法低成本批量构造,再配合大模型质检飞轮保证质量。
以上内容由 Ai好记 转录整理。
Ai好记是一款音视频转图文笔记的AI音视频转录总结工具,支持解析B站、抖音、小红书、小宇宙等平台链接及本地/网盘音视频文件,转录后自动视频转文字生成精华速览、思维导图和结构化笔记等内容形式,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。