文章目录
- D8 | Prompt 调试技巧:为什么 AI 总答非所问?
- 一、为什么这篇是「必修课」
- 二、5 类常见错误(问题画像)
- 2.1 错误 ①:格式错(Format Error)
- 2.2 错误 ②:逻辑错(Logic Error)
- 2.3 错误 ③:幻觉(Hallucination)
- 2.4 错误 ④:过度拒绝(Over-refusal)
- 2.5 错误 ⑤:循环 / 重复(Repetition)
- 三、5 步诊断法(从现象到根因)
- 3.1 Step 1:复现
- 3.2 Step 2:分类
- 3.3 Step 3:定位 Prompt
- 3.4 Step 4:单变量替换
- 3.5 Step 5:AB 对比
- 四、修复策略(5 类各一套)
- 4.1 格式错 → JSON Mode + 强 Schema
- 4.2 逻辑错 → CoT + Self-Consistency
- 4.3 幻觉 → 限定数据源 + 让 AI "不知道就说不知道"
- 武器 1:限定数据源
- 武器 2:让 AI 说"我不知道"
- 武器 3:要求引用
- 4.4 过度拒绝 → 改 system 措辞 + 角色扮演
- 套路 1:明确"这是创作/学习场景"
- 套路 2:换 system 角色
- 套路 3:拆 step 绕过敏感词
- 4.5 重复 → 调 temperature + 改 stop sequence
- 五、3 个真实调试案例
- 案例 1:AI 把订单号说成另一个用户的
- 现象
- Step 1 复现
- Step 2 分类
- Step 3 定位
- Step 4 单变量改
- Step 5 AB 对比
- 案例 2:AI 拒绝回答简单翻译
- 现象
- Step 1 复现
- Step 2 分类
- Step 3 定位
- Step 4 修复
- Step 5 AB 对比
- 案例 3:AI 反复输出"好的好的好的好的"
- 现象
- Step 1 复现
- Step 2 分类
- Step 3 定位
- Step 4 修复
- Step 5 AB 对比
- 六、调试工具箱(5 个常备工具)
- 6.1 温度调节(最常用)
- 6.2 seed 锁定(排查用)
- 6.3 logprobs 看置信度(高级)
- 6.4 Prompt 版本控制(工程化)
- 6.5 eval 集回归(最关键)
- 七、避坑速查表
- 八、这一篇的小结
- 8.1 5 个 Key Takeaway
- 8.2 决策树
- 8.3 思考题
- 下篇预告
D8 | Prompt 调试技巧:为什么 AI 总答非所问?
系列:《60 天 AI 全栈转型:传统开发者的大模型工程师之路》(S1 模块 2 · 收官篇)
作者:刘一说(haohaizi_liu)| 15 年开发管理经验
配套代码:https://gitcode.com/road-emblem/60-days-ai-stack
一、为什么这篇是「必修课」
前 3 篇(D5/D6/D7)我们讲了怎么"写好 Prompt"——CRISPE 框架、Few-shot、CoT、JSON Mode、Function Calling。
但真正落地你会发现:写好 Prompt 只是开始,运行起来全是 bug。
“为什么它又瞎编了?”
“为什么我让它提取姓名,它给我返回一段话?”
“为什么它说’我不能帮你’?”
“为什么它一直循环输出’好的好的好的’?”
这些不是 Prompt 写错了,是调试思路错了。
这一篇我把自己 18 个月里踩过的坑总结成一套5 类错误 + 5 步诊