背景:现在我们使用AI解决问题时需要给出大量的提示词,还有记住和学会大量的提示词以及提示词模版,这对于像我这样比较懒的人根本不适用。
所以我准备探索只用记住最简单的一句提示词,获得更好效果。当然就一句话大概率是解决不了什么问题的所以应当从AI生成提示词来入手,虽然每次问AI要提示词再发给AI让他解决问题,总感觉怪怪的,就好像是像
“你点奶茶,店员问你喝什么,
你说“你推荐一个”。
他说:“那就珍珠奶茶少糖。”
然后你拿着他写的纸条,再排队递给他:“我要珍珠奶茶少糖。”
他才开始做。”,我都有点担心codex给我的用户画像说我有病了。但是效果却出奇的好。如何对比效果呢主要是最终的打分,token消耗,耗时,还有调用次数
这里有五种方案,你们可以猜一下一下几种提示词哪个效果最好,还有一个方案是行不通的,结果绝对会出乎你的意料:
1.提示词生成型 口令:“按需求生成执行提示词,别执行。”
流程:拿到执行提示词 → 开新对话粘贴它 → AI 执行并生成方案。
2.分步方案“按需求生成全阶段提示词包,别执行。”
流程:拿到全阶段提示词→ 开启新的对话粘贴他→完成上一阶段后将这阶段的提示词交给AI直至结束
3.提示词工厂型 口令:“生成一条按需求定制提示词的提示词。”
流程:先得到“提示词生成器” → 用它输入需求,获得执行提示词 → 再用执行提示词完成任务。 它比方案 1 多一层
4.问诊方案“先问关键问题;我不懂的部分请自行假设。”
5.三轮审查型 口令:“先成稿,再审查,最后按意见重写。”
流程明确分三轮:
发需求:根据需求生成完整方案。(这里不写初稿的原因是怕AI开始生成比较低质的内容)
把初稿发回:审查此方案,列出漏洞、风险和修改建议,暂不重写。
把审查意见发回:按审查意见重写为最终方案,保留不确定项。
6.基准方案(用于对比)
直接交给AI不提供额外的提示词
本次实验使用的是codex-gpt5.6 Terra 推理强度高
为了保证不会出现文档复用的情况加了一条限制:本次为独立文档生成任务。禁止读取、搜索、参考当前项目目录下任何已有文档文件。请仅根据本次需求生成全新文档,输出到指定新文件,不得覆盖或合并任何已有文件。
解决的问题:
题目描述
假设你加入一个跨学科团队,需要评估并设计一套太空光伏电站。目标是在2040年前,向地面一处大型城市电网持续提供1GW净功率,全年可用率不低于99.9%,设计寿命不少于20年。
系统需要在太空采集太阳能,将能量传输到地面并接入现有电网。具体技术路线不作预设,但方案必须面对现实世界中的技术、建设、经济、安全和法规条件。你可以判断目标无法按期实现,但需要给出有依据的结论和仍然值得推进的替代目标。
作答要求
请以系统负责人身份提交一份完整的可行性判断和实施方案,使决策团队能够据此决定是否投入、如何推进。你需要自行识别决定成败的关键问题,说明主要判断的依据,以及如何逐步验证方案。如果认为原目标不可行,应清楚说明原因并提出替代路线。
消耗对比表格:
| 方案 | token使用量 | 调用次数 | 耗时 |
|---|---|---|---|
| 方案一 | 0.10 | 16 | 7分13秒 |
| 方案二 | 0.46 | 54 | 26分1秒 |
| 方案三 | |||
| 方案四 | 0.18 | 28 | 45分45秒 |
| 方案五 | 0.35 | 52 | 20分11秒 |
| 基准方案 | 0.1 | 21 | 5分49秒 |
方案三是彻底失败了,原因是大模型理解不了这个意思,使用时还出现了很大的幻觉:
1.直接生成的方案文档
2.生成可以生成方案文档的提示词文档。
除非继续添加说明,那就违背了简单的初衷
评分使用的提示词(Terra-推理强度极高):
你是一位严格、客观、中立的航天系统工程评审专家,同时具备能源、电网、通信、经济、安全与法规背景。 现在有一个题目:评估并设计一套太空光伏电站,目标是在 2040 年前,向地面一处大型城市电网持续提供 1GW 净功率,全年可用率不低于 99.9%,设计寿命不少于 20 年。系统需在太空采集太阳能,将能量传输到地面并接入现有电网。技术路线不作预设,但必须面对现实世界中的技术、建设、经济、安全和法规条件。允许判断目标无法按期实现,但必须给出有依据的结论和仍然值得推进的替代目标。 下面有 5 个方案。请你只依据方案内容和题目要求进行评分,不要因为文字华丽、篇幅长或语气自信而加分。 一、评分维度与权重: 目标达成能力(20%):能否在 2040 年前实现 1GW 净功率、99.9% 可用率、20 年寿命 技术可行性(20%):关键技术是否成熟,是否依赖未经验证的假设 工程与建设可行性(15%):发射、在轨组装、地面接收、并网等是否可实施 经济可行性(15%):成本估算是否合理,是否具备可接受的投入产出逻辑 安全与风险控制(10%):空间安全、地面安全、军事/双用途风险、失效模式 法规与治理可行性(10%):频率协调、轨道资源、责任、跨境许可、监管路径 验证与迭代路径(10%):是否给出分阶段验证、关键里程碑和退出机制 二、评分规则: 每个维度 1–10 分,10 分为最优。 必须给出每个维度的得分和一句核心理由。 加权总分保留两位小数。 如果方案信息不足,必须指出缺少什么,并说明你是按“缺失即扣分”还是“按合理假设补全”处理。 对五个方案使用同一套标准,不得中途改变尺度。 如果某个方案实际上承认目标不可行,但给出了有依据的替代路线,应在“目标达成能力”上如实扣分,但在“验证与迭代路径”“经济可行性”“法规与治理可行性”等维度正常评分,不要一票否决。 三、输出格式: 先给出评分总表: 方案 目标达成 技术可行 工程可行 经济可行 安全风险 法规治理 验证迭代 加权总分 排名 然后逐个方案给出: 一句话总评 各维度得分及理由 最大优点 最大硬伤 如果要把该方案推进到可决策阶段,必须补充的关键信息 最后给出: 最终排名 如果只能选一个方案进入下一阶段,选哪个,为什么 哪个方案最适合作为“原目标不可行时的替代路线” 五个方案共同忽略的关键问题最终评分:叫五终的原因是根据初稿生成了新的文档
| 方案 | 目标达成 | 技术可行 | 工程可行 | 经济可行 | 安全风险 | 法规治理 | 验证迭代 | 加权总分 | 排名 |
|---|---|---|---|---|---|---|---|---|---|
| (一) | 2 | 6 | 6 | 6 | 7 | 7 | 8 | 5.60 | 3 |
| (二) | 2 | 6 | 6 | 7 | 7 | 7 | 9 | 5.85 | 1 |
| (基准) | 2 | 3 | 4 | 4 | 6 | 6 | 7 | 4.10 | 5 |
| (四) | 2 | 5 | 4 | 4 | 6 | 5 | 6 | 4.30 | 4 |
| (五终) | 2 | 7 | 5 | 5 | 8 | 8 | 9 | 5.80 | 2 |
五个方案的字数统计
| 方案 | 去除空白后的字符数 | 含空白字符数 |
|---|---|---|
| (一) | 11,685 | 12,497 |
| (二) | 8,380 | 9,174 |
| (基准) | 6,034 | 6,305 |
| (四) | 6,652 | 7,206 |
| (五终) | 5,172 | 5,504 |
结论:若只看产出质量,方案二最高;若看“质量提升与资源投入的平衡”,方案五终更优;方案一则是最低成本下的有效改进。方案四投入较多但增益最小,不建议作为默认流程。字数与质量没有正相关。
| 方案 | 做法 | 字符数 | Token | 调用 | 耗时 | 评分 | 相对基准提升 |
|---|---|---|---|---|---|---|---|
| 一 | 先生成执行提示词,再新对话执行 | 11,685 | 0.10 | 16 | 7分13秒 | 5.60 | +1.50 |
| 二 | 生成全阶段提示词包,逐阶段执行 | 8,380 | 0.46 | 54 | 26分01秒 | 5.85 | +1.75 |
| 四 | 先问关键问题,不懂处自行假设 | 6,652 | 0.18 | 28 | 45分45秒* | 4.30 | +0.20 |
| 五终 | 成稿→审查→按意见重写 | 5,172 | 0.35 | 52 | 20分11秒 | 5.80 | +1.70 |
| 基准 | 直接交需求 | 6,034 | 0.10 | 21 | 5分49秒 | 4.10 | — |
*耗时含重试,参考价值低于 Token 和调用次数。
- 方案二的方案质量最高,工程量化、成本情景、风险台账和阶段退出机制最完整。代价是 Token、调用和时间均显著增加,适合高重要性、一次性正式报告。
- 方案五终仅 5,172 字,却获得 5.80 分,说明“审查后重写”显著提高了内容密度和自我纠错能力。它比方案二少用约 24% Token、少约 22% 时间,但评分仅低 0.05 分,是最均衡的默认方案。
- 方案一与基准 Token 消耗相同,调用次数反而更少,却让评分提高 1.50 分;但生成文本最长,且未达到方案二、五终的结构化审查深度。适合追求速度、仍希望明显优于直接提问的场景。
- 方案四虽然引入澄清问题,理论上有助于需求准确性,但在本任务中只比基准高 0.20 分,却额外消耗 Token、调用和大量时间。原因很可能是“用户不懂则 AI 自行假设”削弱了问诊的价值:既增加了交互,又没有真正消除关键不确定性。
- 基准方案速度最快、资源最低,但出现关键数量级算术错误,且工程、经济、可靠性闭合不足。对这种跨学科高风险任务,直接生成不够可靠。
字数层面也支持同一结论:方案一最长,却只排第三;方案五终最短,却排第二。这说明篇幅不是质量代理变量,关键在于是否有明确的验证边界、反思/审查环节和可执行的阶段门。
建议选择:
- 正式、重要、允许较高成本:方案二。
- 日常高质量交付的默认流程:方案五终。
- 快速且低成本地提升直接生成结果:方案一。
- 方案四不建议沿用原样;若保留,应把“自行假设”改为“仅对不影响结论的缺失项自行假设;影响技术路线、成本、许可或安全的缺失项必须列为条件和风险”。
这个结果我还是特别出乎我的意料,虽然从token的使用量就可以大概猜到了,但是不同的提示词效果之间的差距还是很大的。
那么我们是否可以将2和5结合起来所以继续改进
主要是有两个地方可以进行结合1.审查提示词包,给出更好的提示词包,在生成一个方案(二改提示词);2.直接审查现成的方案二,生成一个方案(二审);3.审查修改1生成方案,最后再进行效果检查(二改提示词审)
那么直接上最后的数据
| 方案 | 去空白字符数 | 含空白字符数 |
|---|---|---|
| 一 | 11,685 | 11,892 |
| 二 | 8,380 | 8,598 |
| 四 | 6,652 | 6,979 |
| 五终 | 5,172 | 5,246 |
| 基准 | 6,034 | 6,091 |
| 二改提示词 | 8,152 | 8,532 |
| 二审 | 7,454 | 7,635 |
| 二改提示词审 | 9,347 | 9,683 |
| 方案 | 方法 | 技术评审分 | Token | 调用 | 耗时* |
|---|---|---|---|---|---|
| 基准 | 直接生成 | 4.10 | 0.10 | 21 | 5分49秒 |
| 一 | 生成执行提示词,再执行 | 5.60 | 0.10 | 16 | 7分13秒 |
| 二 | 全阶段提示词包,逐阶段执行 | 5.85 | 0.46 | 54 | 26分01秒 |
| 四 | 问关键问题,不懂处自行假设 | 4.30 | 0.18 | 28 | 45分45秒 |
| 五终 | 成稿→审查→重写 | 5.80 | 0.35 | 52 | 20分11秒 |
| 二改提示词 | 先审查方案二的提示词包,再执行 | 6.10 | 0.50 | 61 | 27分20秒 |
| 二审 | 直接审查方案二成稿并修改 | 6.10 | 0.85 | 75 | 51分00秒 |
| 二改提示词审 | 审查“二改提示词”结果后生成最终稿 | 6.25 | 1.05 | 98 | 57分04秒 |
| 方案 | 目标达成 | 技术可行 | 工程可行 | 经济可行 | 安全风险 | 法规治理 | 验证迭代 | 加权总分 | 排名 |
|---|---|---|---|---|---|---|---|---|---|
| 一 | 2 | 6 | 6 | 6 | 7 | 7 | 8 | 5.60 | 6 |
| 二 | 2 | 6 | 6 | 7 | 7 | 7 | 9 | 5.85 | 4 |
| 基准 | 2 | 3 | 4 | 4 | 6 | 6 | 7 | 4.10 | 8 |
| 四 | 2 | 5 | 4 | 4 | 6 | 5 | 6 | 4.30 | 7 |
| 五终 | 2 | 7 | 5 | 5 | 8 | 8 | 9 | 5.80 | 5 |
| 二改提示词 | 2 | 7 | 6 | 6 | 8 | 8 | 9 | 6.10 | 并列 2 |
| 二审 | 2 | 7 | 6 | 6 | 8 | 8 | 9 | 6.10 | 并列 2 |
| 二改提示词审 | 2 | 7 | 6 | 7 | 8 | 8 | 9 | 6.25 | 1 |
核心结论:
- 质量最高:二改提示词审。它补强了证据等级、热—质量闭合、可靠性边界、许可与退出规则,且避免了把情景计算伪装成商业承诺。代价也最大:相比“二改提示词”,多用 0.55 Token、37 次调用、约 30 分钟,只换来 0.15 分提升。因此适合董事会、投资评审、监管沟通等高风险正式材料。
- 方案二系列的最佳效率点:二改提示词。相比原方案二,资源只小幅增加,却从 5.85 提升至 6.10;而“二审”取得同样评分,却额外消耗更多 Token、调用和时间。就这一次样本而言,先改进提示词再执行优于直接审查既有成稿。
- 日常高质量默认流程:五终。它以 0.35 Token、52 次调用和约 20 分钟达到 5.80 分,和原方案二的 5.85 基本处于同一质量档,但资源更少。三轮“成稿—审查—重写”是最容易复用、也最不依赖复杂提示词包的流程。
- 低成本快速方案:方案一。与基准 Token 相同、调用更少,但技术评分从 4.10 提升到 5.60。它不如审查型流程严谨,却是“快速生成可用初稿”的最佳性价比选择。
- 不建议原样采用:方案四。问诊本应消除需求不确定性,但“我不懂的部分请自行假设”抵消了这一优势:既增加交互,又没有要求 AI 将关键假设转化为明确的决策门。它仅比基准高 0.20 分,收益不匹配资源投入。
- 字数不代表质量。方案一最长,却只排中游;五终最短,却接近方案二;二改提示词审并非最长,但评分最高。真正影响质量的是是否做到:区分事实与假设、审查算术和系统边界、建立可验证的阶段门,以及允许停止。
建议的选择方式:
- 快速形成较可靠初稿:方案一。
- 日常正式报告:方案五终。
- 复杂工程/投资议题,且需全阶段提示词:二改提示词。
- 对外提交、重大投资或高安全风险决策:二改提示词审。
- 不建议选择:二审(被二改提示词在本样本中“同分、低资源”压制)和原方案四。
需要保留的客观限制是:这些是单次生成样本,技术评分是专家判断而非统计显著性检验;例如 5.80、5.85、6.10 之间的小差距,不应被理解为稳定的绝对能力差距。但“二审资源显著更高而质量未明显高于二改提示词”“最终审查的边际收益递减”这两个趋势较明确。
最终的意见就是
想要快速高质就是
先生成提示词:提示词生成型 口令:“按需求生成执行提示词,别执行。”(质量想要更高就使用提示词包)
再审查提示词:“以最挑剔的反驳者攻击这个提示词,并给出修改好的提示词方案”