Pixelle-Video 完整上手指南:一个主题 10 分钟生成 AI 短视频成片
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
Pixelle-Video 是一个开源的 AI 短视频引擎:给它一个主题,它包办写稿、配图、配音到合成的全流程。跟着本文走完,你能在自己的电脑上把本地服务跑起来,并拿到第一条成片。
初接触:把服务跑起来
动手前先备好三样东西:
- ffmpeg,负责最后的视频合成。macOS 执行
brew install ffmpeg,Ubuntu/Debian 执行sudo apt install ffmpeg,Windows 到 ffmpeg 官网下载后把bin目录加入 PATH。装完用ffmpeg -version验证,有版本号输出即可。 - Python 3.11 以上和包管理器uv(安装方式见 uv 官方说明)。
- 一个 LLM API Key,写稿依赖大模型。预设里有通义千问、GPT、DeepSeek、本地 Ollama,挑你手头有的。
Windows 用户可以直接跳过环境准备:从项目发布页下载 Windows 整合包,解压后双击start.bat即可启动,依赖全部内置。
按下面 4 步走:
- 克隆仓库并进入目录:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video- 一条命令启动:
uv run streamlit run web/app.py。uv会自动建虚拟环境并装完依赖,首次拉包稍慢,耐心等它结束。 - 浏览器自动打开
http://localhost:8501,展开左侧「⚙️ 系统配置」面板。 - 在 LLM 配置的下拉菜单选一个预设(地址和模型名会自动填好),粘贴你的 API Key,点「保存配置」。
成功信号:浏览器出现三栏界面——左栏内容输入、中栏语音与视觉配置、右栏生成和预览,且配置面板提示保存成功。
能力版图:先试这 4 种用法
- 批量出科普口播:输入一个主题,直接拿到带解说、配图的成片。没有剪辑经验的人,做一条视频的成本降到了打一句话。
- 拿现成稿件直接口播:「固定文案内容」模式可粘贴已有文字,按段落、行或句子拆分。稿件质量有保障时,排版完全可预期,不必赌 AI 改写。
- 自己的照片视频变短片:自定义素材模式上传你拍的照片或视频,AI 先分析内容再写脚本。旅行素材不补拍也能变成带解说的成片。
- 用自己的声音配音:选 Index-TTS 这类支持克隆的工作流,上传一段参考音频,成片旁白就是那个音色。系列视频能保持统一的声音标识。
每条片默认切成 5 个分镜,对应 5 段画面。
配置决策:直接影响成片的 3 个开关
配图从哪条路线来
三条路线按硬件和预算二选一:
- 本地 ComfyUI + selfhost 工作流:有 NVIDIA 显卡且已部署 ComfyUI 就选它,出图最快、不花 API 费用,工作流文件在 workflows/selfhost/ 下。
- RunningHub 云端:没有显卡就选
runninghub/...开头的默认工作流,再到系统配置面板填 RunningHub API Key,本地什么都不用装。 - 直连供应商 API:只有 DashScope、OpenAI、Seedream、Kling 之类的云密钥时,选
api/...工作流,在api_providers里填对应供应商的凭据。
坑:selfhost 服务没起来或模型文件没下载,进度会一直停在「生成配图」不走。开始前先点「测试连接」确认服务可达。
解说音:默认音色还是克隆音色
开箱就用,保持默认 Edge-TTS 即可,零配置、音色选择多。想要自己的声音,换 Index-TTS 并上传一段人声清晰的 MP3,先点「预览语音」试听再正式生成——试听是验证效果成本最低的动作。
坑:克隆只在 Index-TTS 这类支持的工作流里生效,选了 Edge-TTS 再传参考音频不会有任何作用。
模板:按画幅和背景类型选
模板集中在 templates/ 目录,按尺寸分竖屏 1080x1920、横屏 1920x1080、方形 1080x1080 三组,文件名前缀说明背景类型:static_*纯文字,不需要 AI 媒体、最省钱;image_*用 AI 图片做背景;video_*用 AI 视频做背景,最重。发 B 站、YouTube 选横屏组,发抖音、小红书选竖屏组。比如黑底电影质感的image_film,适合解说类内容:
坑:自制模板时,HTML 里 body 的宽高必须和所在分组一致(竖屏目录写 1080 × 1920),否则文字会顶出画面。
实战走查:一条横屏科普片,约 3 分钟出片
目标是做一条横屏科普,主题选「黑洞的形成原理」。选具体知识点而不是「宇宙」这种大词,是因为 LLM 写出的分镜更聚焦,配图也更容易扣题。
- 输入主题。左栏「内容输入」选「AI 生成内容」,填主题,分镜数保持默认 5。
- 中栏基本不动。TTS 留默认 Edge-TTS,挑一条发音清晰的音色;图像工作流保持默认的
runninghub/image_flux.json,它走云端,本地无需任何准备。 - 挑模板。选横屏 1920x1080 组的
image_wide_darktech,16:9 适合长视频平台,暗色科技风也压得住黑洞这种题材:
- 点「生成视频」🎬。进度按「生成文案 → 分镜 N/5 生成配图 → 合成语音 → 合成视频」推进,5 个分镜全程约 2-5 分钟。盯一下进度条:哪个分镜编号长时间不动,瓶颈就在哪一步。
- 收片。合成完成后右栏自动播放,显示时长、文件大小和分镜数;视频文件落在
output/文件夹,历史页面里随时能再打开。
排障:5 个常见失败
- 症状:进度停在「生成配图」,提示连接超时。→原因:本地 ComfyUI 没启动或地址配错。→解法:先确认浏览器能打开
http://127.0.0.1:8188,再回配置面板重测连接。 - 症状:文案生成不出来,弹窗报错。→原因:API Key 不完整、余额不足或网络不通。→解法:重抄一遍 Key 核对字符;用 Ollama 时确认服务已启动且模型已拉取。
- 症状:
uv run阶段依赖反复装失败。→原因:包缓存损坏。→解法:执行uv cache clean,再跑uv sync重装。 - 症状:配图风格和模板不搭。→原因:提示词前缀写了中文,或尺寸超出模型支持范围。→解法:前缀改成英文风格描述,宽高控制在 1024x1024 附近。
- 症状:生成耗时明显变长。→原因:分镜数多,或撞上云端 API 高峰。→解法:调少分镜数;有本地 GPU 就切 selfhost 工作流。
从「输入一个主题」到「拿到一条成片」,这套流程被压缩成了一次点击:写稿、配图、配音、合成全部由机器完成。生成完第一条视频后,可以去 docs/zh/ 中文文档里找自定义视觉风格、声音克隆的分场景教程继续往下试;想理解各环节怎么运转,workflows/ 目录下的 JSON 工作流文件就是最直接的答案。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考