电商商品描述生成是典型的高频、低单价、大规模场景。GPT-5.6 Luna 降价 80% 后,输入成本压到 0.20 美元/百万 token,这让"批量出稿"从成本敏感变成了成本可忽略。但便宜不等于好用——当单日生成量从几百篇拉到上万篇,风格漂移、质量波动、品牌调性稀释的问题会被指数级放大。我们团队最近把 Luna 接入了商品文案管线,这篇分享下质量管控的实操做法。
对奇点智能大会(2026)的完整技术议题感兴趣,可前往奇点大会官方渠道免费获取PPT详细资料。
商品信息结构化:Prompt 模板是质量的第一道闸
Luna 的轻量特性决定了它更适合"喂饱数据、快速出活",而不是反复纠偏。所以核心思路是把输入侧做重,让模型少做推理、多做填空。
我们的 Prompt 模板拆成四层结构:
| 层级 | 内容 | 示例 |
|---|---|---|
| 商品元数据 | 类目、品牌、SKU、价格带 | 类目:无线降噪耳机;价格带:¥800-1200 |
| 参数清单 | 技术规格、材质、尺寸等硬属性 | 驱动单元:40mm;续航:30小时;重量:250g |
| 卖点标签 | 预提炼的核心卖点,按优先级排序 | ①-42dB深度降噪 ②通透模式对话 ③双设备同连 |
| 风格指令 | 语气、场景、禁忌词 | 科技感偏温暖,避免"极致""碾压"等绝对化用语 |
实际调用时,这四层会拼接成一个结构化的 user message。关键技巧是用 JSON 格式包裹,而非自然语言描述,这样 Luna 的解析稳定性明显提升,格式错乱率从早期的 7% 降到了 1% 以下。
{"category":"wireless_headphones","brand_tone":"科技温暖感,避免绝对化用语","specs":{"driver":"40mm","battery":"30h","weight":"250g"},"selling_points":["42dB降噪","通透对话","双设备同连"],"constraints":["禁用'极致''碾压'","必须提及续航数字"]}约束风格漂移:system message 与 few-shot 的双保险
批量生成中最头疼的是同批次文案风格不一致——有的偏硬广、有的像说明书、有的突然冒出网络梗。Luna 作为轻量模型,上下文理解深度有限,需要更明确的约束机制。
system message 的写法我们迭代了三版,最终定稿的结构是:
你是一位[品牌名]的资深文案。输出要求: 1. 每段不超过50字,多用短句 2. 技术参数用"数字+单位"呈现,不加形容词修饰 3. 场景描述以第二人称"你"开头 4. 禁止出现:极致、碾压、最强、颠覆 5. 结尾固定句式:"了解详情 >"这个 system message 控制在 80 字以内,避免 Luna 因指令过长而忽略后半段。
few-shot 示例的筛选逻辑则是另一层保险。我们不是随机挑历史文案,而是建立了一个"高转化文案池"——过去 90 天内点击率前 10% 的商品描述,经人工标注后按类目分类存储。每次生成时,从对应类目中抽取 2-3 条作为 few-shot,既保证风格锚定,又避免示例过时。
有个细节:few-shot 示例需要定期轮换。我们每月更新一次池子,淘汰转化率下滑的文案,防止 Luna 学到过时的表达习惯。
人工抽检与自动评分的组合拳
日产量过万时,全量人工审核不现实。我们的做法是分层质检:
第一层:自动过滤硬规则
- 敏感词命中(品牌竞品名、违禁词)
- 格式合规(是否包含固定结尾、参数是否完整)
- 长度异常(超出/低于阈值 20% 的文案自动标红)
第二层:语义相似度评分
把 Luna 生成的文案与"高转化文案池"中的同品类文案做 embedding 对比,计算余弦相似度。我们设定的阈值是 0.72——低于这个值,说明风格偏离较大,进入人工复核队列。
这里用的是向量数据库的批量查询,单次可处理数千条,不会成为瓶颈。
第三层:人工抽检的抽样策略
不是随机抽,而是按相似度分布分层抽样:
- 相似度 < 0.65 的:100% 人工复核
- 0.65-0.75 的:抽 30%
0.75 的:抽 5% 做 spot check
这样把有限的人工审核资源集中在风险最高的区间。
A/B 测试框架:用转化率说话
质量管控最终要落到业务指标。我们设计了一个持续的 A/B 测试机制,对比三个版本的文案表现:
| 分组 | 文案来源 | 流量占比 |
|---|---|---|
| A 组 | Luna 生成 | 50% |
| B 组 | 人工撰写 | 25% |
| C 组 | GPT-5.5 生成(历史方案) | 25% |
测试周期固定为 14 天,覆盖完整的用户行为周期。核心追踪指标按优先级排序:商品详情页转化率 > 加购率 > 停留时长 > 点击率。
目前跑下来的数据趋势是:Luna 组的转化率与人工组差距在 3% 以内,但成本只有后者的 1/20;相比 GPT-5.5 组,Luna 在响应速度上有明显优势(平均 120ms vs 450ms),这对需要实时生成文案的闪购场景很关键。
测试中的注意事项:
- 同一 SKU 的文案版本固定,避免用户多次访问看到不同版本
- 新 SKU 上线时,先跑 24 小时的小流量灰度,确认无异常后再全量
- 每月做一次跨组对比报告,动态调整 Luna 的 Prompt 和 few-shot 策略
合规风险的主动规避
电商文案的合规底线不能碰。我们在 Luna 的生成链路中埋了三层防护:
输入层过滤:商品参数接入前经过标准化清洗,杜绝夸大或虚假参数流入 Prompt。
输出层拦截:硬规则命中"绝对化用语""医疗功效暗示"等风险表述时,自动替换为兜底文案并告警。
事后审计:每周导出命中拦截的 case,人工复盘是 Prompt 缺陷还是商品信息本身有问题,形成闭环。
这套机制跑下来,Luna 的批量生成从"能用"变成了"敢用"。核心经验是:轻量模型的优势在于速度和成本,但要把质量稳住,必须在输入结构化、风格约束、分层质检三个环节投入足够的工程化建设。便宜不是省事的借口,而是把资源重新分配到管控环节的契机。
推荐阅读:
📢最后,说一件事2026 奇点智能大会,终于要和大家见面了。
11 月 20-21 日·北京,奇点智能研究院联合 CSDN,把两场技术大会放在了同一个时空里:
奇点智能技术大会(始于 2016)——聊大模型、AI Native、企业级 AI 落地、多模态与世界模型;
C++ 及系统软件技术大会(始于 2005)——聊现代 C++ 演进、AI 算力与推理优化、高性能低时延系统。
为什么要放在一起?因为我们越来越相信——上层 AI 应用的爆发,离不开底层系统软件的支撑;而底层技术的演进方向,也正在被 AI 重新定义。
这次大会汇聚 70+ 位技术专家、18 个主题、1000+ 同行到场。如果你也在这些方向上做研究、做产品、做工程,别错过。