dufu:中文文案去掉机器腔,怎样保留原意?
dufu(杜甫)是一套中文润色 Skill,供能读取 SKILL.md 的 Agent 使用。它帮助检查套话、调整表达,并要求保留事实、数字和原意;附带的检测脚本只提供规则提示。
这篇属于“我的 100 个开源项目”系列。前面介绍过选题和上传工具,这次把注意力放到写稿:技术说明已经写清楚了,为什么读起来还是像一段产品宣传?
文案里的机器腔,具体从哪里找?
“全面提升效率”“赋能创作者”很容易写出来,却没有交代谁做了什么。介绍一个工具,如果读者看完仍不知道输入什么、得到什么,换几个形容词也解决不了问题。
dufu 把常见问题拆得很具体:模板连接词、抽象名词、冗长定语、过于对称的句子,以及反复出现的总结。这些线索能帮作者定位需要重读的地方。技术创作者可以先检查产品介绍、教程开头和发布文案,再决定哪些句子确实需要改。
有操作顺序的教程可以保留“首先、其次”。有准确因果关系的句子也不用为了少一个词就拆掉。判断应落到这一句是否让人理解,不能把词表变成禁用清单。
怎样先检查,再动手改?
dufu 有直接改、先诊断和深度改三种路线。普通润色默认交付改写结果;先诊断只列问题和建议,不改全文;深度改允许调整段落顺序,但要先列出保留的信息。诊断结果按位置、原句、问题和建议组织,便于逐句核对。执行规则
如果还没想好是否重写,可以这样向 Agent 提要求:
使用 dufu,先诊断这段产品说明,只列影响理解的问题和原句位置,暂时不要改写。保留产品名、版本、数字和原始立场。
拿到诊断后,再指定要改的段落。这样能把“哪里难读”和“怎么改”分开处理,原稿也方便留作对照。
输入也要给得具体。比如这段文字用于项目 README,读者第一次接触工具,希望留下安装前提和限制;那就把这些要求和原稿一起交给 Agent。只说“写得高级一点”,很容易把清楚的说明改成更多修辞。需要短稿时,还可以说明哪些段落允许压缩,哪些命令和参数必须原样保留。
想快速扫一遍文本,还可以在项目目录执行:
python scripts/detect.py--file./input.txt--json这个命令需要 Python 和 UTF-8 文本文件。它不会调用一个远程检测服务,脚本本身读取文本后按固定规则分析;改写仍由读取 Skill 的 Agent 完成。脚本源码
表达变自然了,事实也要留住
对技术文章来说,“读起来顺”只是一个条件。版本号、时间、接口名、参数限制和产品承诺改错了,句子再自然也不能直接发。
下面是为说明方法编写的示例,不是项目的实际运行记录:
原句:为了进一步提升资料整理效率,我们进行了导出流程的优化。新版支持将搜索结果导出为 JSON 和 Markdown。
改写:我们改了导出流程。新版支持把搜索结果保存成 JSON 和 Markdown,方便继续整理资料。
改写保留了两种格式,也没有增加“快了多少”“一键完成”等原稿没有的信息。如果原文没说明优化效果,不能添上节省几小时的故事;如果写的是“可能支持”,也不能顺手改成“已经支持”。
dufu 的规则要求保留人物、数字、专名、因果关系和原始立场。我的使用建议是,把这些信息单独列成检查项,改完再对照原稿。涉及引用时,措辞润色也不能代替查证出处。写作规则
复核可以先只看事实,再看文风。第一遍检查数量、条件和承诺有没有变;第二遍检查句子是否顺、段落是否重复。发现一句话缺少依据时,回到资料补证据或删去主张,不靠改成更像真人的口吻掩盖问题。
检测结果能证明文章是谁写的吗?
不能。detect.py 检查的是文本特征:是否出现预设连接词、抽象词和对称句式,是否有较长句子,以及能否找到部分时间、数字或地点线索。输出包括命中的词、句子长度和启发式提示,没有“AI 写作概率”字段。
这些规则的覆盖范围有限。人工写的文章也可能命中“因此”,模板稿也可能完全避开词表。脚本找到的数字线索不等于事实已经核验,没有找到时间地点也不代表文章质量差。
所以,检查结果适合用来挑出值得重读的句子。它不能证明作者身份,不能保证通过第三方检测,更不能替文章的原创性、准确性和平台审核作结论。dufu 自身也明确不承诺“检测必过”。
开始使用前,需要准备什么?
从项目仓库取得 Skill 文件,按你所用 Agent 的安装方式放入可读取的位置,再提供原稿、读者、用途和不可改动的信息即可。dufu 自身无需注册账号或申请专用 API Key;Agent 的运行方式和费用仍取决于你使用的工具。
截至 2026 年 10 月 3 日,公开仓库清单为 1.0.2,采用 MIT 许可证;GitHub 与 Gitee 的 HEAD 提交一致。项目地址:GitHub 主仓、Gitee 镜像。版本以以后读取的仓库清单为准。
给它第一段原稿时,先说明需要诊断还是改写。收到结果后对照事实,再通读语气和段落。技术内容有些术语本来就必须准确,保留它们比刻意追求口语化更合适。