我见过太多人把提示词工程理解成“好好说话”——把需求写详细一点,跟AI多聊几轮,然后抱怨输出还是不行。另一种情况也很常见:费了半天劲调出来的提示词,换个任务就废,根本没法沉淀成自己的东西。
这篇文章不打算铺理论,直接给10个我实测过、能立刻改变输出质量的提示词技巧。每一条分成三块说清楚:它解决什么问题、它为什么有效、可以直接套用的模板长什么样。文章后半部分附了一份模板库,一共10个模板,覆盖文案、总结、分析、编程、决策五类高频场景,把占位符替换成你的真实内容就能用。
适合谁看?如果你经常用各类大语言模型处理工作,却总觉得“别人的提示词比我的好用”,或者同一段提示词这次行、下次不行,这篇就是给你准备的。
1. 为什么你写的提示词总差一口气:三个底层认知
1.1 大模型不是搜索引擎,它在“顺着你的话往下写”
很多人第一次接触这类工具时的用法,是“问一个准确的问题,然后等答案”。这是把大模型当成搜索引擎了。搜索引擎是从海量网页里把你需要的现成内容捞出来,你可能得到的是别人早就写好的段落;而大语言模型在收到输入之后,做的是一次“最自然的下文接续”——它顺着你给的文字,一个词接一个词地生成大概率出现的后续内容。
这个区别带来一个非常关键的推论:模型的输出质量,不取决于你的问题“准不准确”,而取决于你给出的“文字上下文”是否把它引向了正确的方向。你给的约束越明确、示范越清晰,它的“接续”就越靠近你想要的结果。
我做个测试你就明白了。直接输入“帮我写一篇文章”,模型最可能回你一篇四平八稳的通用内容,因为“文章”这个词在训练数据里对应的平均形态就是这样。但如果你输入“帮我写一篇800字左右的公众号推文,目标读者是25到35岁在一线城市打拼的上班族,语气亲切,标题要让人有点击欲”,输出立刻不一样。不是因为它突然“听懂”了需求,而是这段话把“文章”这个模糊概念,收敛成了具体的用途、风格和长度。
1.2 提示词的实质:给一个“会读心的实习生”下需求
我常用的类比是:把模型想象成一位知识量惊人、但没有任何背景框架的实习生。这位实习生什么书都读过,但他不知道你的行业背景、不知道你的老板喜欢什么风格、不知道你手头这份资料里哪句话更重要,更不会主动追问。
你布置任务时只说“把这份资料整理一下”,他会按最普遍、最安全的方式整理。至于按什么维度分类、重点突出什么、输出成什么格式,全靠他“猜”。猜错了真不能怪他——如果现实中这样带实习生,责任在发指令的人。
所以写提示词的本质,就是像给新来的实习生写需求说明:任务是什么、给谁用、什么格式、重点是什么、忌讳什么。把这些说清楚,对方才能一次做到位。这套思路是所有技巧的总纲,后面十条可以理解成这个总纲在不同场景下的具体动作。
1.3 判断提示词好坏的三个维度
在逐条讲技巧之前,先给一个衡量标准,否则你调提示词的时候根本判断不了“到底改对了没”。我自己的经验是盯三个维度:
| 维度 | 怎么判断 | 不合格的表现 | 合格的表现 |
|---|---|---|---|
| 有效性 | 输出能否直接使用 | 拿到结果还要大改 | 小修甚至直接用 |
| 稳定性 | 同一个提示词多次运行 | 时好时坏、忽高忽低 | 质量稳定在可接受范围 |
| 可复用性 | 换掉具体内容后能否再战 | 每次都要从零写 | 换个变量就能复用 |
后续十个技巧,其实分别瞄准这三个维度:前三个主要解决“有效性”,中间四个主要解决“稳定性”,最后三个主要解决“可复用性”。你可以在实践中把每一条对号入座,调优时会更有方向感。
2. 技巧一到三:先把“话说清楚”,输出就稳了一半
2.1 技巧一:角色设定不是装饰,是限制“自由发挥”的围栏
很多人写提示词时会加一句“你是一名资深文案”,但加完就忘了利用它。实际上,角色设定的核心作用不是“讨好”模型,而是给它的输出划定概率范围。
大模型生成文字时,会在海量可能的“下一词”里做选择。如果你说“你是一名初中物理老师”,它后续用词的分布会整体偏向教学场景:更多类比、更多生活化例子、更少的公式堆砌。这种影响是词级层面的,所以比一句“请讲得简单一点”有效得多。
我的实测对比:直接问“解释一下什么是区块链”,输出是一篇中规中矩的百科式说明;加上“请用八年级学生能听懂的语言来解释,多用生活中的比喻”之后,输出立马出现“账本”“很多人一起记账”这类画面感强的表达。同样一个知识,不同的角色设定决定了它怎么“拆开”讲给你听。
提示:一个清晰的角色就够了,不要“你既是一名资深律师,又是一位亲和力很强的主播,还是一个育儿专家”,角色叠加会让模型无所适从,输出变成大杂烩。
可直接套用的模板:
你是一名【角色,如:拥有10年经验的电商文案策划】。 服务对象是【目标人群,如:第一次网购的老年人】。 请你用【语气风格,如:耐心、口语化、少用英文缩写】的方式,完成以下任务: 【具体任务】2.2 技巧二:把“泛动词”换成“动作指令”,模型才有执行依据
“分析一下”“研究一下”“处理一下”“优化一下”——这些词在人类同事之间能沟通,因为对方会结合语境自动补全“分析”的具体含义。但模型不会,它只会按字面找一个最普遍的理解来执行。
我见过最典型的失败案例:让人工智能“优化”一封求职邮件,结果它只是把个别词换成近义词,通顺了一点但结构没变。原因就是“优化”太泛了,模型不知道你想优化语言流畅度、逻辑结构还是篇幅长度。
正确做法是把“优化”替换成具体动作:改写、压缩、扩写、调整结构、换语气、删掉口语词、补充数据支撑,每一项都是明确指令,模型能直接执行。
| 泛动词 | 具体动作指令 |
|---|---|
| 分析 | 列出3个可能原因,并说明因果关系 |
| 优化 | 压缩到200字以内,保留核心信息 |
| 总结 | 按“背景、结论、下一步”三段式概括 |
| 研究 | 对比A和B两种方案的优劣势,各列3条 |
模板:
请对以下内容执行【具体动作】: - 动作:【改写 / 压缩 / 提取要点 / 调整结构 / 更换语气】 - 保留:【必须保留的信息】 - 删除:【可以删除的信息】 内容如下: 【粘贴原文】2.3 技巧三:给示例比给规则强十倍(Few-shot的正确姿势)
一次让模型按指定格式输出时,很多人会选择写一大段规则:“请注意,输出必须包含A、B、C三个字段,字段名必须精确为这样,顺序不能乱……”结果模型还是经常丢三落四。
但如果你直接给出两个“输入→输出”的完整示例,模型对格式的理解会瞬间清晰。原因是模型本质上是在学“模式”,示例比抽象规则更容易捕捉。这一招在信息抽取类任务里尤其明显。
举个例子,我想从用户评价里提取情感倾向,如果只写“请提取情感和关键词”,输出格式五花八门;只要给出两个示例,它就稳定多了:
任务:从用户评价中提取情感倾向和关键词。 示例1: 输入:这个耳机音质不错,但戴久了耳朵疼。 输出:情感=偏负面;关键词=音质、佩戴舒适度 示例2: 输入:物流很快,包装也仔细,整体满意。 输出:情感=正面;关键词=物流时效、包装 请按同样格式处理下面这条评价: 输入:【你的真实评价内容】提示:示例不在多在精。同一格式给两到三个例子就够了,多了反而占用上下文空间,还可能引入干扰信息。
3. 技巧四到七:用结构约束让模型“按套路出牌”
3.1 技巧四:输出格式要写“格式说明+具体示例”
“请用表格整理”——这句话其实很模糊。是几列?列名叫什么?行数据怎么组织?模型猜不准的时候,就会自己定义一套表头,有时三列,有时四列。
想让输出格式稳定,最有效的做法是“描述加示例”双管齐下:先用一句话说明格式,再给出一个表格样例,让模型照着填。
请把以下内容整理成Markdown表格,共4列: | 序号 | 项目 | 金额 | 备注 | 请把原始资料里的每一条都单独成行,金额统一保留两位小数。 原始资料: 【粘贴内容】这套写法在要求JSON结构输出时同样适用。如果你做程序接入,可以直接在提示词里写明字段定义,甚至附上一段最小的JSON示例,模型的遵循程度会显著提升。
请提取以下合同的关键信息,以JSON格式输出,字段固定为: {"合同编号": "", "甲方": "", "签署日期": "", "总金额": ""} 合同原文: 【粘贴内容】3.2 技巧五:思维链让模型先打草稿再回答,复杂任务不再“一眼假”
“请一步一步思考”这六个字,是提示词工程里性价比最高的指令之一。背后的机制是:当模型被要求先输出中间步骤时,它会在每一步把自己的推理摊开,而不是直接跳到一个“看起来合理”的最终答案。后者恰恰是很多低级错误的来源——模型在数据里见过大量“先给结论”的表达,跳步时容易选中一个最顺口的错误答案。
拿数学题举例:一件衣服原价360元,打七折后参加每满200减20的活动,最终到手价多少?如果不要求分步,模型有时会直接算成232元(因为它把满减基数和折后价的关系搞混了)。但是只要在提示词后面加一句“请先算折后价,再判断是否满足满减条件,最后计算到手价”,它就会规规矩矩给出:折后价252元,满足每满200减20的活动,最终232元。
这还不是最重要的。思维链真正的价值在复杂任务里,比如做方案规划、写代码、做多条件判断。每多一步中间推理,模型犯“逻辑跳变”的概率就明显下降。
请按以下步骤思考,全部完成后在“最终答案:”之后给出结论。 1. 先提炼任务的关键约束条件; 2. 根据约束条件列出可选方案; 3. 对每个方案做最简评估; 4. 给出你认为最优的方案,并说明理由。 任务:【你的任务】3.3 技巧六:温度参数不是摆设,它和提示词是同一套组合拳
很多人翻来覆去改提示词,却忽略了生成参数。大模型服务通常有一个“温度”(temperature)参数,控制的是生成时的随机性。温度越高,输出越发散、有创意;温度越低,输出越稳定、保守。
如果你的任务偏事实和结构(总结、抽取、翻译、代码生成),温度应该调低一些,比如0到0.3;如果是写故事、起标题、头脑风暴,温度可以放到0.7以上。这条经验我反复验证过:很多“提示词不稳定”的抱怨,其实是温度太高导致的,跟提示词本身关系不大。
那没有参数调节界面、只有聊天输入的普通用户怎么办?也有办法——在提示词里加入“收敛性”的描述:
请给出唯一确定的答案,不要提供多个备选方案,选择最符合要求的一版输出。这句话本质上是在引导模型降低自己的“发散倾向”,效果接近调低温度。虽然不能完全替代参数,但在日常使用中已经能明显降低结果的随机性。
3.4 技巧七:边界条件一次说清,省掉“对答案”的返工
现实中布置任务,你会说清楚预算多少、截止时间、哪些事千万别碰。但到了给模型下指令时,很多人只讲“要什么”,不讲“不要什么”。结果模型把不要的东西也给了,你还得回头补一刀。
边界条件至少包括四类:必须包含什么、不能出现什么、篇幅控制在多少、风格抄哪份参考。举一个高频场景——写邮件:
请帮我写一封向客户说明项目延期的邮件。 要求(必须满足): - 语气诚恳,先道歉再说明原因; - 不得出现具体甩锅对象; - 给出新的交付时间和补救措施; - 全文控制在200字以内。 补充背景:【你的背景信息】这样写,比“帮我写一封道歉邮件”少走至少两轮返工。边界条件描述得越具体,“补丁式”对话就越少。
4. 技巧八到十:多轮迭代与工程化管理,才是长期降本的关键
4.1 技巧八:把大任务拆成“提示词流水线”,而不是让模型一口吃成胖子
很多人对着模型一次性下达大任务:“帮我把这本产品手册改写成十条短视频脚本。”然后得到一个四不像:信息太密、节奏不对、重点不清。
问题出在任务粒度太大。更合理的做法是把它拆成一条提示词流水线——每个环节只做一件事,做完一步,把结果作为下一步的输入。
拿“把产品手册改成短视频脚本”举例,我会拆成四步:
- 让模型从手册里提取核心卖点,列出清单;
- 让它基于卖点提炼3个用户痛点场景;
- 让它为每个场景产出5个备选标题;
- 最后才套用脚本模板生成完整脚本。
每步之间我可以人工干预:哪条卖点不成立就直接删掉,哪个标题跑偏就先纠正。这种“人机协作式流水线”和工业流水线很像——每道工序只专注一件小事,质量和效率都比一锅端高得多。更重要的是,中间步骤沉淀下来的“卖点清单”“痛点列表”本身就可以复用到其他任务里。
【流水线第1步】 请从以下产品资料中提取核心卖点,按“功能、体验、价格、售后”四类归纳,每条卖点不超过20字: 【粘贴资料】4.2 技巧九:加一句“请检查你的回答”,模型会真的回头看
一个经常被人忽略的事实是:模型“回头看”自己输出时,能发现不少初稿里的小毛病,尤其是格式不符合要求、漏掉了约束条件、前后矛盾这类问题。
我在处理需要严格格式输出的场景时,会在提示词末尾追加一句“完成初稿后,请检查是否符合上述全部要求,不符合的地方直接修正”,输出质量提升非常明显。原理很简单:生成时模型是“边写边想”,注意力集中在展开内容上;再给它一次审视机会时,它可以对照之前列出的约束做一遍检查,类似于写完文章之后从头通读一遍改错。
需要说明的是,这种方法对“格式类、约束类”错误的修正效果最好,但对“内容品味”类问题帮助有限——模型很难判断自己写得好不好笑、有没有感染力。判断“好不好”依然是人要做的事。
请完成以下任务:【任务描述】。 你的回答必须满足:【2到3条硬性要求】。 写好之后,请自己检查一遍,确认每一条要求都已满足,如有遗漏请直接修改后再输出最终版。4.3 技巧十:像管代码一样管你的提示词版本
这是十条里最“工程化”的一条,也是我最希望早点学会的一条。早期我调试提示词,全凭记忆,改了几个字、为什么改、有没有效果,完全靠心情。结果就是:某天写出了特别好用的提示词,几天后想复现,却记不清当时改的是哪里。
后来我改成“像管代码一样管提示词”的做法:每个常用提示词单独存一个Markdown文件,文件头部放版本记录表。格式很简单:
| 版本 | 日期 | 改动内容 | 效果评价 |
|---|---|---|---|
| v1 | 2024-06-01 | 初版,角色定义为“资深编辑” | 输出偏正式,可接受 |
| v2 | 2024-06-03 | 增加few-shot示例 | 格式稳定性大幅提升 |
| v3 | 2024-06-05 | 删除角色设定,改纯任务指令 | 效果反而变差,回滚v2 |
这套管理方式看起来很笨,但长期收益极大。三个月后你再看,能清楚知道哪些方向有效、哪些是白费功夫。接触提示词工程两三个月后,最容易出现的瓶颈不是不会写,而是“写了很多但没沉淀”。版本记录就是对抗这种“无效勤奋”的手段。
5. 模板库:10个替换占位符就能上手的提示词模板
5.1 使用模板库前,先花30秒做这件事
模板不是万能药,用之前请先把每一处用【】括起来的占位符替换成你自己的信息。最常犯的错是占位符没替换干净就发送,模型只能当填空题做——输出当然牛头不对马嘴。
另外,模板里的“角色”“目标人群”“语气”三个变量是捆绑的,必须互相匹配。比如角色是“严肃的财务审计师”,语气就不该写“轻松活泼”,否则模型的输出会在两种风格里来回摇摆。
下面十个模板,我按场景分成四组:文案写作、总结学习、分析编程、决策辅助。全部实测可用。
5.2 文案写作类模板(模板一至三)
模板一:公众号推文初稿
你是一名微信公众号编辑,目标读者是【人群画像】。 请根据以下素材,写一篇【字数】字左右的推文。 要求: - 开头用故事或场景引入,不要直接说明主题; - 每段不超过线【4】行; - 结尾给一个明确的行动建议; 素材: 【粘贴素材】模板二:多版本标题生成
请根据以下内容,生成【5】个标题候选。 要求: - 标题长度控制在【15-25】字; - 风格分别覆盖:悬念型、数字型、利益型、反问型、情感型; - 不要使用标题党式的夸大表述。 内容核心:【一句话说明内容主题】模板三:口语化改写
请把以下文字改写成口语化的表达,适合在视频脚本中朗读。 要求: - 每句话尽量短,避免嵌套从句; - 把专业术语换成日常说法,无法替换时用括号补充解释; - 保留原文的核心信息和顺序。 原文: 【粘贴原文】5.3 总结学习类模板(模板四至六)
模板四:会议纪要生成
你是一名会议记录专员。请根据以下会议记录素材,整理成结构化纪要。 输出结构: 1. 会议主题 2. 参会角色(代号即可) 3. 决议事项(每条一句话) 4. 待办事项(包含负责人和截止时间) 5. 遗留争议点 素材: 【粘贴素材】模板五:费曼式知识讲解
请用费曼学习法解释【主题】。 要求: - 先给一个一句话定义; - 再用一个生活化类比展开; - 再指出最容易误解的3个点; - 最后用一句话总结。 面向对象:【读者背景,如:没有相关基础的初学者】模板六:长文精华压缩
请将以下长文压缩成适合速读的摘要。 要求: - 总字数不超过【200】字; - 必须保留:原始结论、关键数据、可执行建议; - 不出现原文里的例子和铺垫性内容。 原文: 【粘贴原文】5.4 分析与编程类模板(模板七至九)
模板七:数据异常排查
你是一名数据分析师。以下是某业务指标最近【7】天的数据: 【粘贴数据】 请帮我: 1. 指出明显的异常点和异常方向; 2. 列出可能导致该异常的3个潜在原因; 3. 对每个原因给出验证思路。模板八:代码解释与注释
请解释下面这段代码的作用,并逐行添加注释。 要求: - 先说明整体功能; - 再解释每段关键逻辑; - 标注哪些部分容易出bug; 代码: 【粘贴代码】模板九:报错信息诊断
我在运行以下代码时遇到报错,请帮我定位原因并给出修复方案。 代码: 【粘贴代码】 报错信息: 【粘贴报错】 要求: - 先说明报错的直接原因; - 再给出修改后的代码; - 最后补充一条避免同类问题的建议。5.5 决策类模板(模板十)
模板十:结构化决策分析
你是一名决策顾问。我需要做一个决策: 【描述你的决策问题,如:是否应该更换供应商】 请按以下结构输出: 1. 决策目标(用一句话重述); 2. 备选方案(至少2个); 3. 每个方案的优缺点(各列3条); 4. 每个方案需要的关键信息(我现在还没掌握的); 5. 给出你的初步建议和理由。提示:所有模板里的【占位符】都可以成组替换。把模板存成文件后,用全局替换功能一次性改掉所有变量,比逐条手改快很多。
6. 模板失效的5个常见原因:这些坑我替你先踩过了
6.1 上下文污染:最隐蔽的“失灵”原因
这是日常使用中最容易踩、也最难察觉的坑。你在同一个对话窗口里先聊了半小时无关话题,再粘贴模板执行任务,模型的输出往往不如开新会话时那么好。原因在于,模型在多轮对话里会把前面所有内容当作“历史背景”,前面聊的闲话会悄悄改变它对后续指令的理解权重。
解决方法也很简单:重要任务一律新开一个会话再执行。有时候你以为提示词“失效”了,其实只是被前面的对话带偏了。
6.2 占位符没替换干净
听起来是个低级错误,但实际中特别常见。复制模板后忘记替换【具体任务】【目标人群】这些占位符,模型只能按照占位符的字面意思“生成一个任务描述”,而不是执行任务。
更隐蔽的情况是只替换了开头一处,后面还有第二处、第三处同样的占位符没换。建议每次使用前做一次查找,看看还有没有残留的【】。
6.3 角色、任务、语气三者冲突
模板里同时有角色、任务、语气三个变量,它们的风格必须互相一致。如果角色是“严谨的财务分析师”,任务却是“写一段轻松的朋友圈文案”,模型的输出会非常别扭,因为它同时收到两套彼此矛盾的要求。
解决方法是统一变量:确定一个主导风格,让另外两个变量向它靠拢。给模型的目标越一致,它的执行就越坚决。
6.4 要求太多且互相打架
在一条提示词里堆十个要求,其中还包含“尽量简短”和“说清楚细节”这种天然矛盾,模型只能根据自己训练时见过的常见搭配做随机取舍。结果就是每条要求都沾一点,但每条都没做到位。
遇到这种情况我会做“减法”,一条提示词里硬性要求控制在3到5条,并且按优先级排序。重要的靠前写,不重要的干脆删掉,或者拆到下一轮对话里处理。
6.5 不同模型对同一提示词的反应差异
同一份模板在GPT系列、Claude、国内大模型平台上的表现,可能有明显差别。有的模型对角色设定更敏感,有的对格式示例更敏感,有的会因为一个“温度”参数差异而给出截然不同的结果。
所以模板库里的内容不是“一次适配、处处可用”。我的习惯是:每个模板在换到新的模型平台时,先用最小的测试样例验证一遍,再正式投入使用。这个动作只需要一两分钟,却能避免大段返工。
6.6 我的工作流里,提示词工程该占多少比重
写了这么多,我想说一句实在话:提示词工程不是越多越好。如果一个小任务花两分钟手动就能完成,就不值得花十分钟去设计一个完美提示词。我自己会把精力集中在两类场景上:一是重复性高、每周都要做的任务,这类值得用模板库固化下来;二是复杂度高、返工成本大的任务,这类值得用思维链和流水线技巧慢慢打磨。凭经验说,日常80%的收益来自把十来个核心模板维护好,而不是追求提示词技巧的全而深。先从两三个模板开始,跑顺了再逐步扩充,这是我最推荐的上手路径。