如何快速上手image-to-editable-ppt-skill:5分钟把图片PPT转成可编辑对象的入门教程
【免费下载链接】image-to-editable-ppt-skillCodex skill for converting slide images, PDFs, and image-based PPTX files into editable PowerPoint decks.项目地址: https://gitcode.com/gh_mirrors/im/image-to-editable-ppt-skill
image-to-editable-ppt-skill是一个面向 Codex 的 AI skill,能把你手头的幻灯片图片、PDF、图片版 PPTX 逐页重建成可编辑的 PowerPoint 文件:可读文字恢复为原生文本框,简单几何恢复为 PowerPoint 形状,复杂视觉元素保留为可独立移动的图片资产。换句话说,截图式 PPT 从此也能改字、挪框、换色,不再受"整页是一张图"的束缚。
一、它能做什么?3 类输入全覆盖
很多人遇到这类场景:同事发来一套 PPT 截图、一份扫描版 PDF、或一个"所有页面都是图片"的 PPTX,想改一个字都得用图片编辑软件硬抠。这个 skill 就是为这种场景准备的:
| 输入 | 输出 |
|---|---|
| 1 张图片 | 1 页可编辑.pptx |
| 多张图片 | 多页.pptx,按提供顺序排列 |
| 多页 PDF | 多页.pptx,页码一一对应 |
| 图片版 PPT | 页数一致的.pptx,并原样保留页面备注 |
核心能力包括:
- 📝 文字按 OCR 实测坐标和字号还原,同级文字字号自动统一
- 📐 简单几何恢复为原生形状,曲线支持"编辑顶点"调弧度
- 🧮 普通行列表格重建为 PowerPoint 原生表格,单元格可编辑
- 🖼️ 复杂视觉元素(照片、插画、图标)作为带来源记录的独立图片资产
注意:它负责"把已有页面变成可编辑",不负责从零生成一套新 PPT。如果没有强烈的可编辑需求,直接让图像编辑模型改图会更轻量,详见 docs/faq.md。
二、安装前:2 个必知前提
在动手前,花 1 分钟确认两件事,可以少走很多弯路:
1. 建议使用「完全访问权限」
本 skill 运行时间较长,会自动执行 OCR、图片生成/编辑、文件读写、子 agent 分派和长时间轮询。"请求批准"模式会频繁打断流程,"替我审批"模式也可能在 OCR 阶段拦住请求——如果你不在电脑旁,转换就会停住。建议在 Codex 权限设置中选择"完全访问权限":
2. 额度消耗较高,先拿单页试水
复原一个 10 页 PPT 可能消耗大量 token,单页复原时间可能在 10 分钟以上。推荐 ChatGPT Pro 用户使用;Plus 用户请谨慎,第一次建议先用 1 页测试效果与耗时。
另外推荐(非必须):到百度 AI Studio 免费申请一个 PaddleOCR-VL 的 Access Token,用于校正文字框坐标和字号。首次使用时 AI 会主动询问一次,把 Token 发给它即可完成配置,一次配置长期生效。不配置也能运行,但文字还原质量会打折扣。详细配置说明见 docs/installation.md。
三、1 分钟安装:让 AI 帮你装
安装不需要手动执行任何命令。推荐直接把这句话发给你的 agent:
安装 image-to-editable-ppt 这个 skill,地址是 https://gitcode.com/gh_mirrors/im/image-to-editable-ppt-skillAI 会自动完成安装,包括 skill 依赖的editppt命令行工具(它会在执行 skill 的过程中自动安装)。
也可以手动安装:从仓库 Releases 下载image-to-editable-ppt-skill-v*.zip,解压后把其中的image-to-editable-ppt文件夹放到 agent 的 skills 目录(Codex 为~/.codex/skills/image-to-editable-ppt),再重启 agent。更新方式类似,凭据保存在~/.editppt/config.yaml,更新不会丢失。
skill 的入口规则定义在 skills/image-to-editable-ppt/SKILL.md,想深入了解执行细节可以从这里读起。
四、最短使用方式:一句话触发转换
在 Codex 中用$image-to-editable-ppt选中该 skill,图片、PDF 和.pptx可以直接粘贴、附加到对话框,也可以提供本地路径:
$image-to-editable-ppt 把这张图片转成可编辑 PPT。 $image-to-editable-ppt 把这些图片转成一个可编辑 PPT。 $image-to-editable-ppt 把 <path-to-deck.pdf> 转成可编辑 PPT。之后你基本只需要等待。整个转换由 AI 自动编排,背后是一套多 agent 协作流程:
- 归一化输入:创建独立任务目录,把输入拆成
pages/page_NNN/source.png逐页任务 - OCR 文字标注:为每页生成文字框坐标、实测字号和字号分组,让文字还原"按测量值来",不靠目测
- 页面分派:单页由主 agent 本地重建;多页则按并发槽位分派给 page worker 并行处理
- 逐页重建与自检:每页重建可编辑文本、形状和图片资产,对照源图自检并修正
- 最终组装与校验:按页顺序重建最终
.pptx,复制页面备注,并运行 deck 级校验
完整流程说明见 docs/workflow.md。
五、转换结果怎么看?
每次转换都使用独立输出目录,所有中间文件和最终结果都保存在其中:
| 文件 | 作用 |
|---|---|
final/{origin}_edited.pptx | 最终可编辑 PowerPoint 文件 |
final/validation.json | 最终 deck 校验结果 |
final/run_summary.json | 本次转换摘要 |
pages/page_NNN/ | 每页的重建工作区(源图、预览图、manifest 等) |
拿到结果后建议做三件事:
- 用 PowerPoint 打开,检查文字、形状和图片资产是否可以分开编辑
- 对照
pages/page_NNN/preview.png与源图,确认缺字、错位或资产缺失 - 查看
final/validation.json确认校验通过
需要提醒:部分图片元素和文字位置可能有轻微偏移,不保证 100% 复刻原图;复杂视觉元素(照片、插画、纹理)通常只能整体移动,内部对象不可编辑。更多质量相关说明见 docs/faq.md。
六、常见问题速答
Q:转换到一半停住了怎么办?先检查是否处于"请求批准/替我审批"权限模式,流程正在等待你手动审批。每页状态记录在任务目录的page_jobs.json和run_state.json,可以让 AI 检查运行状态并继续未完成页面。
Q:非 Codex 环境(如 Claude Code)能用吗?有条件支持:agent 需要支持 skill 加载、文件读写和 CLI 执行,多页任务还需要 subagent 分派机制。非 Codex 环境通常没有 Codex OAuth,需要让 AI 帮你配置 OpenAI-compatible 图片 API fallback(凭据同样写入~/.editppt/config.yaml)。
Q:如何更新到最新版?直接发一句"更新 image-to-editable-ppt 这个 skill"给 agent 即可;变更内容可查看 CHANGELOG.md。
写在最后
总结一下这套 5 分钟上手的完整路径:装 skill(1 分钟)→ 配置权限与可选 OCR Token → 发一句转换指令 → 等待多 agent 逐页重建 → 打开.pptx开始编辑。
它把"图片式 PPT 不可编辑"这个老痛点,用多智能体视觉重建的方式真正解掉了。更多项目背景与使用细节,建议配合 README.md 和 docs/quickstart.md 一起阅读。
<输出文章结束>
【免费下载链接】image-to-editable-ppt-skillCodex skill for converting slide images, PDFs, and image-based PPTX files into editable PowerPoint decks.项目地址: https://gitcode.com/gh_mirrors/im/image-to-editable-ppt-skill
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考