千笔-AIWritePaper · https://www.aiwritepaper.com
定性证据综合(QES)里最容易买错的不是「哪个模型更会写主题」,而是把检索助手、筛题排序、主题编码、信心评估当成同一选型。Evidence Synthesis Ireland 公开场次标题为Putting the AI into QuAlItative Evidence Synthesis: opportunities and caveats(讲者公开信息:Prof. Andrew Booth,University of Sheffield / SCHARR;场次页与 HSC R&D 预告可打开)。公开预告强调:按综合阶段匹配工具能力(检索—筛题—主题/框架分析—信心评估),并以透明报告与反思性实践连接「技术可能」与「可信综合」。本文不扩写视频简介腔、不编造讲者原话,而把可操作验收落成选型表 + 人工终裁分层 + 能写/不能写 + 失败含义(对标 BrainX 88 写法,不停留在只有闸门的 82 地板)。逐字稿本次未稳定保存,语料以公开预告、讲者公开简介与可打开文献主题为准。
视频:https://www.youtube.com/watch?v=i2BAoLkuHMc
场次页:https://evidencesynthesisireland.ie/conference/webinar-prof-andrew-booth-putting-the-ai-into-qualitative-evidence-synthesis-opportunities-and-caveats/
图:检索/筛题/抽取/信心四栏选型;三道人类终裁;底部能写不能写与可审计产物。
目标说明
读完应能独立完成五件事:
- 用一句话说清验收核:先选对综合阶段工具,再抽检主张,最后由人类写下 adopt / trial / defer / reject。
- 对照选型表,判断当前任务属于检索、筛题、抽取还是信心评估辅助。
- 列出「能写 / 不能写」边界,避免把流畅综合写成证据等级。
- 当天跑最小实验:
esi-selection.csv+esi-club-extract.csv+esi-adjudication.csv,至少 1 条 reject/defer。 - 对外披露时把公开预告要点标成预告快照,不写成你团队已完成的 QES 结论。
适用边界
适合
- 护理/公卫/社会医学课题组试用 AI 辅助 QES,需要把门禁写进 SOP。
- journal club 已有协议论文,但讨论停在「AI 好快」。
- 需要区分「检索式草案」与「系统检索完毕」。
- 希望把不确定性写成行级终裁,而不是把主题模型输出写进指南。
不适合
- 把 webinar 扩成「AI 已可无人值守完成定性综合」站队文。
- 无人类终裁就把模型主题写进政策建议或系统综述结论。
- 只有聊天记录,无选型表/抽检 CSV,却宣称已部署 QES-AI。
- 伪造「已按 CERQual 自动出具信心等级」。
- 索要危险操作细节:本文只验收流程门禁。
风险
公开预告同时谈 opportunities 与 caveats,本身反对单点神话。社区讨论常见关切包括技能流失、偏倚、保密与可靠性——这些应进limitations,不是当标题党。最小实验证明闸门可跑通,不是某条定性主张为真。视频未逐字核验的句子一律不当引语。
选型 / 验收表
| 阶段 | 更合适 | 人类必做 | 产物 | 失败含义 |
|---|---|---|---|---|
| 检索 | 检索式/同义词草案 | 锁纳入排除并保存检索日志 | search-log.md | 把聊天检索当系统检索 |
| 筛题 | 标题摘要排序建议 | 双人独立筛 + 分歧表 | screen-log.csv | AI 通过率当纳入率 |
| 抽取 | 主题/框架编码草案 | 对原文核对语境与引文 | extract.csv | 脱离语境的标签 |
| 信心/报告 | 信心陈述草稿 | 人工终裁等级与反思 | adjudication.csv | 流畅综合当证据等级 |
完整表见_w/esi-selection.csv。
能写 / 不能写(终裁强度来源)
对标高分 YouTube 写法:边界必须可执行,不能只写「需谨慎」。
| 对象 | 能写 | 不能写 |
|---|---|---|
| 公开预告 | 阶段匹配、透明报告、反思性实践是可信综合条件 | 「本场已证明某工具准确率 xx%」(无逐字核验勿写) |
| 检索助手输出 | 检索式草案与漏检风险 | 「已完整检索完毕」 |
| 筛题建议 | 辅助记录与分歧候选 | 「自动纳入结论」 |
| 主题编码 | 可核对摘录与候选主题 | 「主题已证实 / 可进指南」 |
| 信心草稿 | 供人类勾选的等级草案 | 「CERQual 已自动终裁」 |
| 对外沟通 | 助手非替代;日志可审计 | 「AI 综述等于系统评价」 |
机制要点:三道人类终裁
G1 · 选型终裁(先分类,再试用)
问三句:当前卡在检索、筛题、抽取还是信心?有没有必须打开的原文指针?失败时停在哪一层?选错类型直接reject试用,不必先追生成速度。
G2 · 主张抽检(预告要点与论文主张都要行级)
每条一行:source_id,claim_text,support_span,limitations,human_decision,reviewer,timestamp。
决策枚举:adopt_for_club/trial_only/defer/reject。
当天不允许write_into_qes_results或auto_cerqual_final。
G3 · 综合越权(AI 最多交缺口列表)
定性综合默认升级为人类终裁。AI 可起草「未覆盖情境 / 未报告反思 / 检索式差异」;不得输出主题终局或政策建议。这与 BrainX 式终裁一致:增强、不替代专业判断。
当天最小实验
- 选 1 个真实任务:例如「为 QES journal club 准备 3 条主张」。
- 填选型表:说明为什么不用另外阶段的工具冒充。
- 对公开预告 + 至少 1 个可打开相关主题来源抽 ≥5 行。
- 人类终裁;必须含 1 条
defer或reject(例如:把「AI 可增强流程」写成「可无人值守」→ reject)。 - 产出:selection + club-extract + adjudication。
| 产物 | 证明 |
|---|---|
| esi-selection.csv | 阶段没选错 |
| esi-club-extract.csv | 主张可抽检 |
| esi-adjudication.csv | 人类终裁留下枚举 |
可验证清单
- 视频 URL 已引用:
i2BAoLkuHMc。 - 选型四栏能口头讲解。
- 抽检 ≥5 行,含至少 1 个 defer/reject。
- 能写/不能写表可脱离产品名独立使用。
- 未把公开预告写成已完成的系统评价结果。
- 未编造讲者原话或虚假准确率。
踩坑
- 只有闸门清单,没有终裁分层:容易停在 82 地板。
- 把筛题加速写成纳入结论。
- 主题标签不回原文。
- 用社区焦虑标题党代替行级 limitations。
- 无 reject 样本的「全绿 club」。
- 把逐字稿缺失当成可以脑补金句。
journal club 90 分钟排期(可抄)
- 10 分钟:念选型表,锁定本周阶段。
- 25 分钟:打开预告要点,抽 3 条可否定主张。
- 20 分钟:补 1 个可打开来源,问「它限制了什么」。
- 20 分钟:逐行终裁,强制 1 条 reject/defer。
- 15 分钟:核对能写/不能写,删掉越权句。
为什么要对标 BrainX 88 而不是停在闸门 82
昨日 CARMA 类「闸门 + CSV」可以过徽章但仍可能停在 82;BrainX 冲到 88 的增量是终裁分层 + 能写/不能写 + 可审计产物。本篇把同一强度迁到定性证据综合:四栏选型不够,必须能口头讲清 G1/G2/G3,并且写出「能写/不能写」以免 club 记录全是正确废话。
公开语料怎么用(再次强调)
- ESI 预告:阶段列表与透明/反思要求 → 可作 club 主张来源。
- 讲者公开简介:方法学背景 → 可说明「为何听这场」,不可冒充现场原话。
- 社区关切文献主题(技能、偏倚、保密、可靠性)→ 可作 limitations 列参考,须标明来源层级。
可审计目录建议
club/2026-09-13-esi-qes/ selection.csv club-extract.csv adjudication.csv preview-notes.md minutes.mdpreview-notes.md只记打开预告的日期与摘录要点,不写「讲者说:……」除非你有核验过的逐字稿。
权限升级变更单
仅当连续两次 club 日志完整、方法负责人书面同意、失败可回滚、对外口径仍是「助手非替代」,才讨论超出trial_only的权限。缺一条就保持试验态。定性综合的风险,常常不是模型不会归纳,而是组织太快把草案写成证据。
阶段误配的典型故事(虚构结构)
故事一:把聊天检索当成系统检索完毕,结果补检索时发现关键库与年份下限从未锁定。失败含义:检索阶段选型错误。
故事二:筛题模型给出高分「通过」,团队省略双人筛,分歧个案在抽取阶段爆雷。失败含义:把 AI 通过率当纳入率。
故事三:主题模型输出漂亮词云,直接写进讨论「患者体验三点」。失败含义:脱离语境标签升级为结论。
三则故事都不必指责模型「不聪明」,问题在人类终裁缺席。选型表的价值是把故事变成行级reject理由,而不是事后复盘感叹。
与定量综述工作流的差异提醒
定性综合更依赖语境、反思与信心评估;照搬「自动抽取效应量」思路会更危险。故 G3 综合越权闸在 QES 场景应默认更严:AI 可列缺口,不可代写终局主题与政策句。
对外口径
「我们试用 AI 辅助 QES 的检索/筛题/编码草案,所有主题与信心等级由人类终裁;公开预告与 club 日志可审计。」
能写/不能写扩示例句(可直接贴进 minutes)
能写:「本周 AI 仅生成筛题建议,双人筛分歧 6 条,人类纳入 2 条。」
不能写:「AI 已完成筛题,纳入率 91%。」
能写:「主题草案 5 个,已对原文核对 3 个,其余 defer。」
不能写:「患者体验主题已证实。」
能写:「信心等级草案供讨论,终裁未完成。」
不能写:「CERQual 高级信心(AI)。」
把「能写/不能写」练成会议书记的肌肉反应,club 记录才不会在对外传播时翻车。这也是冲高分写法相对「只有闸门名」的差额所在。
与 BrainX 文的复用边界
BrainX 篇侧重临床工具 vs 通用模型 vs 综述工作流;本篇侧重 QES 阶段内选型。可以互相链接,但不要复制同一张表换标题。读者应能看出:一个解决「工具类型」,一个解决「定性阶段」。
总结
定性证据综合里用 AI,靠的是选型表 + 终裁分层 + 能写/不能写 + 可审计产物,不是更会写的主题故事。先跑通三份 CSV,再谈是否扩大权限。去掉任何产品名,读者手里仍应剩下可审计边界。