千笔-AIWritePaper · https://www.aiwritepaper.com
编辑部、图书馆和科研诚信岗位在搭「可靠研究」工具链时,最常见的失败不是工具买少了,而是把不同层的输出当成同一种结论:把论文工厂预警当成欺诈认定,把「有数据可用声明」当成数据真的可复用,把引用语境里的「对比」当成原文已被推翻。
本文的素材是 Research Solutions 频道的公开网络研讨会回放Stargazing the Future of Reliable Research: LLMs, Clear Skies, DataSeer, and Scite(视频 id8yzWk3_by0I,2025-01-22 发布,时长 1:01:13)。嘉宾是 Clear Skies 创始人兼 CEO Adam Day、DataSeer 创始人兼 CEO Tim Vines,以及 scite 联合创始人、Murray State 大学心理学教师 Sean Rife(姓名据其个人简历与 ORCID 核对,字幕中识别不清);主持人为独立顾问 Adrian Stanley 与 Research Solutions 的 Sharon。本文依据视频的英文自动字幕逐段核对,下文方括号里是时间戳;引述均为意译,不是逐字原话,自动字幕可能有识别误差。本文不给三家打分排名,只做三件事:按问题选层、分层验收、终裁与能写/不能写。
视频:https://www.youtube.com/watch?v=8yzWk3_by0I
图:上方三层(信号 / 实践 / 引用语境)各自输出什么;中部人工核验;底部终裁四档与能写/不能写。
目标说明
读完应能独立完成五件事:
- 说清三家在研讨会中各自讲述的角色,以及每层输出不是什么。
- 按你要回答的问题选层,而不是按品牌或功能清单选工具。
- 为每层写出验收标准:信号层只产出待查清单,核验层留下人工记录,终裁层要有签名。
- 用 adopt / trial / defer / reject 四档做终裁,且至少有一行 defer 或 reject。
- 对外写材料时守住能写/不能写边界,不把研讨会观点写成已生效政策。
适用边界
适合
- 期刊编辑部想把投稿初筛、数据政策核查、引用核验串成一条流程。
- 图书馆或科研管理部门评估诚信类工具,需要一份可复核的选型记录。
- 研究者想在引用某篇论文前确认它后续被怎样讨论。
不适合
- 想要「哪家最准」的排名:研讨会没有给出可比的准确率数据,本文也不编造。
- 想用工具自动处罚作者:嘉宾明确反对由机器做欺诈判断(见下文)。
- 需要产品价格、接口细节:研讨会未涉及,请以各家官方资料为准。
研讨会里可核实的三个角色
| 工具 | 讲者 | 研讨会中的描述 | 时间戳 | 这层输出不是什么 |
|---|---|---|---|---|
| Clear Skies | Adam Day | 数据分析公司,做了首个论文工厂检测服务 Papermill Alarm;以网络分析(如合著关系)发现问题论文集中的社群 | [07:15–09:39] | 不是欺诈认定 |
| DataSeer | Tim Vines | 用自然语言处理识别论文中的开放科学实践(如数据共享);用大模型做简单判断,例如推断漏填的基金号,再交作者确认 | [09:39–13:38] [51:32–53:10] | 不是数据质量证明 |
| scite | Sean Rife | 用深度学习把引用语句分为支持、对比、提及(研讨会口述为 contrasting,scite 论文中称 disputing);与出版商有索引协议,覆盖开放与非开放全文;呈现撤稿等通知;生成式助手与检索分开设计 | [13:38–18:29] [47:30–49:06] | 不是结论已被推翻 |
三点关键原话(意译):
- Adam Day:规模化模式可以说明一批论文有共同特征,但这本身不是欺诈证据,必须由人去看并作出判断 [23:19–24:53];即使有完美的 AI,把欺诈判断自动化仍然是不道德的 [22:31–24:06]。
- Sean Rife:他在上课或引用前会看一篇论文的引用报告,关注它是否被后续研究「强烈对比」,并特意说「不是被驳倒」[16:51–17:38]。
- Tim Vines:数据集被复用时,正式引用只在大约一成的情况下出现(讲者口头估计),其余是顺带提及或缩写,AI 可以据此重建「推定引用」[52:21–53:10]。
按问题选层(不按品牌选)
| 你要回答的问题 | 选哪层 | 输出形态 | 必须附带的人工动作 |
|---|---|---|---|
| 这批投稿里有没有值得重点查的 | 信号层(如论文工厂预警、网络分析) | 待查清单与理由 | 专人逐篇核看 |
| 作者说的数据和代码是否真的可获取 | 实践层(开放科学实践识别) | 声明与实际共享情况对照 | 打开链接、检查数据是否对得上 |
| 这篇论文后来被怎样讨论 | 引用语境层(支持/对比/提及) | 引用语句列表与撤稿通知 | 读原文上下文再下结论 |
| 这篇该不该发、该不该撤 | 不交给任何一层 | — | 编辑与诚信委员会终裁 |
最后一行是整张表的门闩:三层都只提供证据,裁决权不在工具里。
分层验收
| 层 | 通过标准 | 失败含义 | 产物 |
|---|---|---|---|
| L1 信号 | 每条预警附理由;标注为「信号」而非「认定」;预警率被记录 | 分数被直接写进作者信 | signal-log.csv |
| L2 核验 | 每条信号有人工核看记录:看了什么、结论、核看人 | 信号未经核看就升级 | review-log.csv |
| L3 终裁 | 四档之一;签名与日期;给作者回应窗口 | 口头决定、无签名 | adjudication.csv |
L1 到 L3 不能跳级。Adam Day 在研讨会中还提到,一位作者如果有长期、标识清晰(如 ORCID)且从未被标记的发表记录,本身就是有价值的上游信息 [33:52–34:39];但他同时强调即使历史记录很差,也仍要由人作判断。这正好说明 L1 的任何信号,包括「历史良好」,都不能替代 L2。
层间交接字段(让三层能对上号)
三层工具各自输出不同格式,最容易断的是交接处。建议每条记录至少带下面这些字段,否则 L2 核看人不知道信号从哪来、L3 终裁人不知道核看过什么:
| 字段 | 谁填 | 说明 |
|---|---|---|
| item_id | 系统 | 稿件号或 DOI,三层共用 |
| layer | 系统 | signal / practice / citation |
| raw_output | 系统 | 工具原始输出,保留原文不改写 |
| reason | 系统或初筛人 | 预警理由、识别到的共享声明、引用语句原文 |
| reviewer | 核看人 | L2 人工核看者,不得与终裁人为同一人 |
| checked | 核看人 | 实际打开了什么:原文段落、数据链接、引用上下文 |
| verdict | 终裁人 | adopt / trial / defer / reject,或对单篇的处理决定 |
| notice_sent | 终裁人 | 是否给作者回应窗口 |
raw_output和checked两列最关键:前者防止信号在转述中被放大,后者证明人确实看过。
终裁表(四档)
| 档位 | 条件 | 例子 |
|---|---|---|
| adopt | 三层都已跑通,人工核验记录完整,试点中未出现把信号当认定的情况 | 投稿初筛接入信号层,所有预警进入人工队列 |
| trial | 某层输出可用,但人工核验流程尚未定岗 | 引用语境层先给编辑参考,不进决定信 |
| defer | 输出和你的问题对不上,或缺少可复核的记录 | 想用实践层判断数据真伪(它只识别共享实践) |
| reject | 流程要求工具直接作出处罚或认定 | 「预警分超过阈值自动退稿」 |
门禁:终裁表里没有任何 defer 或 reject 行,说明你只做了采购清单,没有做选型。
能写 / 不能写
| 能写 | 不能写 |
|---|---|
| Clear Skies 讲者介绍了论文工厂预警服务与网络分析方法 | 「Clear Skies 认定某文为论文工厂稿」 |
| 讲者表示规模化模式本身不是欺诈证据,需人工判断 | 「预警分数高即可退稿」 |
| DataSeer 用 NLP 识别论文中的数据共享等开放科学实践 | 「DataSeer 证明该数据集真实可靠」 |
| scite 把引用语句分为支持、对比、提及 | 「被标为对比 = 结论已被推翻」 |
| 讲者估计数据复用的正式引用约占一成 | 「研究证实数据引用率为 10%」 |
| 嘉宾对未来十年科研经费的判断是个人预测 [54:00–55:38] | 「研讨会指出科研经费将被大幅削减」 |
| 研讨会是 2025 年 1 月的公开讨论 | 「本刊已采用上述工具与流程」 |
研讨会里值得带走的三个设计原则
- 检索与生成分开。Sean Rife 介绍,scite 的生成式助手负责「读和写」,另有独立系统负责查找文献;普通大模型把两件事混在一起 [47:30–48:18]。你自己搭工具链时,也应把「找证据」和「写结论」拆成两个可分别验收的步骤。
- 上游数据质量优先。Adam Day 的说法是:第一条规则是先产出好数据,第二条是练好修数据的本事,因为总会要修 [33:03–33:52]。对应到流程里,就是投稿系统的元数据、标识符要先规范。
- 警惕错误悄悄传播。Adam Day 提到写作助手给出的内容若被略读放过,中间的错误可能进入文献而无人察觉 [44:19–45:06]。这正是 L2 必须留下「看了什么」的原因。
可审计产物
_w/toolchain-selection.csv:问题 → 层 → 输出 → 人工动作_w/toolchain-layer-acceptance.csv:L1–L3 验收记录_w/toolchain-adjudication.csv:四档终裁,必含 defer 或 reject_w/yt/8yzWk3_by0I.txt:自动字幕整理稿(带时间戳)
踩坑
- 把研讨会里的产品介绍直接抄成采购理由,没有写本单位要回答什么问题。
- 信号层和核验层由同一个人一键完成,没有独立核看记录。
- 把「对比」引用数量当成论文质量评分。
- 引用研讨会时写成「专家一致认为」:嘉宾之间也有分歧,例如 Tim Vines 担心少数人借 AI 大量制造垃圾研究 [24:53–26:35],Adam Day 则强调 AI 让造假更快、但未必增加不诚实的人数 [20:52–21:42]。
当天 45 分钟脚本
| 分钟 | 动作 |
|---|---|
| 0–10 | 写下本单位要回答的三个问题,填选层表 |
| 10–20 | 为每层写通过标准与失败含义 |
| 20–30 | 拿一篇脱敏稿件走一遍 L1→L2,记录核看内容 |
| 30–40 | 填终裁表,至少一行 defer 或 reject |
| 40–45 | 对照能写/不能写,删掉越界句子 |
总结
可靠研究工具链的选型,单位不是工具,而是层:信号层告诉你先查哪里,实践层告诉你作者做了什么,引用语境层告诉你学界怎么讨论,裁决始终在人。研讨会里三位嘉宾反复强调同一件事:工具给证据,人做判断。把这句话写进验收表和终裁表,比比较哪家功能多更有用。
参考:视频 https://www.youtube.com/watch?v=8yzWk3_by0I (Research Solutions,2025-01-22;本文依据英文自动字幕核对)