skills3 技能库文档四件套:Word、PDF、PPT、Excel 一个 SKILL.md 全搞定
2026/8/28 13:08:06 网站建设 项目流程

skills3 技能库文档四件套:Word、PDF、PPT、Excel 一个 SKILL.md 全搞定

【免费下载链接】skillsPublic repository for Agent Skills项目地址: https://gitcode.com/GitHub_Trending/skills3/skills

这是一套面向 Agent 的文档技能包,docx、pdf、pptx、xlsx 四个模块各配一份 SKILL.md 说明加现成脚本,专门解决"每次处理办公文档都要重新踩一遍 OOXML 和库的坑"这件事。

🗂️ 四个模块能干什么,一表看懂

技能适用场景关键工具或做法
DOCX新建 Word、改现有文档、修订跟踪、加批注docx-js 新建;解压后直接改 document.xml;pandoc 抽文本
PDF合并/拆分/旋转、抽文本表格、填表单、加水印、扫描件 OCRpypdf、pdfplumber、reportlab,配合 qpdf、pdftotext
PPTX从零做 deck、复用公司模板、批量增删幻灯片pptxgenjs 生成;thumbnail.py 出幻灯片缩略总览图;add_slide.py / clean.py 管结构
XLSX建模、公式维护、清洗脏数据openpyxl 写公式,pandas 批量进出;recalc.py 重算校验

每个模块的入口文档都放在自己目录里,例如 DOCX 技能说明、PDF 表单填写指南。

📝 DOCX 修订跟踪怎么做

H3 什么时候用它多人协作改合同、报告,需要每一处改动都留痕、可审查;或者要往带跟踪修订的文档里加批注。

H3 怎么上手

  1. 用 pandoc 把文档转成 markdown,先把要改的内容看明白。
  2. 解压 .docx,先跑 merge_runs.py 把碎片化的文本 run 合并,文字才找得到。
  3. 把改动按 3-10 个一批分组,用<w:ins>/<w:del>包住实际改动的文字,不要重复未改部分。
  4. 重新打包,跑 validate.py 并带--author参数,确认没有漏标修订的地方。
  5. 要出一份接受全部修订的干净版,用 accept_changes.py 生成。

H3 一条实用提示Word 会把一行字拆进几十个<w:r>片段,你看得见的短语在 XML 里可能根本不是一个连续字符串——先合并 run 再搜索,能省一大半时间。

📑 PDF 合并拆分与表单填写常用方法

H3 什么时候用它把多份材料拼成一份、按页拆分、抽表格进 Excel,或者要往政府、银行的官方表单里填字。

H3 怎么上手

  1. 定任务类型:合并拆分旋转用 pypdf,抽文本表格用 pdfplumber,从零造 PDF 用 reportlab。
  2. 合并操作长这样:
from pypdf import PdfWriter, PdfReader writer = PdfWriter() for f in ["a.pdf", "b.pdf"]: for page in PdfReader(f).pages: writer.add_page(page) with open("merged.pdf", "wb") as out: writer.write(out)
  1. 填表单前先用 check_fillable_fields.py 判断有无可填字段。
  2. 有字段就提取字段 JSON 逐个赋值;没有字段就先转成逐页图片,人工确认坐标再写。
  3. 扫描件走 pdf2image 转图加 pytesseract 的 OCR 路线。

H3 一条实用提示reportlab 里千万别用 Unicode 上下标字符,内置字体没有这些字形,印出来是一排黑方块,要用<super>/<sub>标签代替。

🖼️ PPTX 怎么做出不模板味的幻灯片

H3 什么时候用它要从零生成一份 deck,或者必须复用公司 .potx 模板、往里塞内容。

H3 怎么上手

  1. 新建用 pptxgenjs 脚本,动手前先设好 pres.layout,默认画布是 10 英寸宽而不是 13.3 英寸。
  2. 用模板时先跑 thumbnail.py 生成带编号的幻灯片总览图来挑版式,第二参数一定要命名成 deck 自己的前缀。
  3. 先做结构再填内容:add_slide.py 复制幻灯片、改 presentation.xml 调顺序、clean.py 清掉孤儿文件。
  4. 十六进制颜色不带 # 号也不能写 8 位,演讲者备注走 addNotes 而不是文本框。
  5. 最后 validate.py 加--original对照模板校验,模板自带的报错不会算到你头上。

H3 一条实用提示颜色给错格式是静默损坏文件的高发点——#FF0000和 8 位带透明度的写法都会让 PowerPoint 直接打不开这个 deck。

🧮 Excel 公式零错误怎么保证

H3 什么时候用它做财务模型、预算表,或任何交付后还要被人改输入、公式要跟着重算的表格。

H3 怎么上手

  1. 用 openpyxl 把公式当字符串写进单元格,绝不写 Python 算好的死值。
  2. 先写 2-3 个公式确认取数符合预期,再铺开整张表。
  3. 跑 recalc.py,LibreOffice 会把公式全部算一遍,看到 total_errors 为 0 才算过关;退出码为 0 不等于没错误。
  4. 函数选 Excel 2007 时代的 SUMIFS、INDEX、MATCH、IFERROR;XLOOKUP、FILTER 这类会算出来一个"零错误但只有左上角有值"的假干净文件。
  5. 按行业惯例上颜色编码:蓝字硬编码输入、黑字公式、绿字跨表引用、红字指向外部文件,关键假设加黄底。

H3 一条实用提示重算全绿只证明公式"算得动",不算"算得对"——差一行的区间引用照样给你一个零错误的错误答案。

🔗 四个模块怎么串起来用

当你要做一份季度汇报时:xlsx 出模型,pptx 把关键数字做成大字号 callout 页,docx 写带修订跟踪的正文报告,最后 pdf 把附件拼成一份对外文件。四个模块各自产出的都是标准格式,互不依赖。

当扫描件里藏着要用的数据时:先用 pdf 模块 OCR 出文本,再用 xlsx 的 pandas 路线结构化成表,最后回到 pptx 做对比图——pdf 负责"看得懂",xlsx 负责"算得动",pptx 负责"讲得出"。

当要批量填官方表单时:pdf 目录下的 forms 流程是唯一入口,先判字段再决定走哪条路,别上来就画坐标。

🚧 避坑清单

  • OOXML 编辑后不要格式化 document.xml,直接原地改,重新打包前删掉旧输出文件,否则已删的部件会"复活"。
  • 接受修订时,被删的段落标记应当并入下一段,而 accept_changes.py 和 pandoc 都可能留下空段落,交付前去 XML 里核对一遍。
  • 带外部链接的 xlsx 用 openpyxl 另存会丢链接,重算还会把整列变成 #NAME?,先手动把那些单元格的值抄出来。
  • 合并单元格只写左上角锚点,MergedCell 的 .value 是只读的。
  • 跨表引用里带空格的表名要加引号,少一个引号整格 #VALUE!。

🪜 三步跑起来

  1. 克隆仓库:git clone https://gitcode.com/GitHub_Trending/skills3/skills
  2. 通读对应模块的 SKILL.md,每个文件开头的表格就是任务分派器。
  3. 拿个小文件试一遍,然后跑对应验证脚本,比如 recalc.py 和 docx 目录下的 validate.py,看到零错误再交付。

文档工作里最贵的从来不是写内容,而是格式坑——这套技能包把四个格式各自的坑都提前填平了你只需要专注内容本身。

【免费下载链接】skillsPublic repository for Agent Skills项目地址: https://gitcode.com/GitHub_Trending/skills3/skills

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询