☰
Pixelle-Video 完整上手指南:一个主题 10 分钟生成 AI 短视频成片
2026/10/2 13:44:29 网站建设 项目流程

Pixelle-Video 完整上手指南:一个主题 10 分钟生成 AI 短视频成片

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

Pixelle-Video 是一个开源的 AI 短视频引擎:给它一个主题,它包办写稿、配图、配音到合成的全流程。跟着本文走完,你能在自己的电脑上把本地服务跑起来,并拿到第一条成片。

初接触:把服务跑起来

动手前先备好三样东西:

  • ffmpeg,负责最后的视频合成。macOS 执行brew install ffmpeg,Ubuntu/Debian 执行sudo apt install ffmpeg,Windows 到 ffmpeg 官网下载后把bin目录加入 PATH。装完用ffmpeg -version验证,有版本号输出即可。
  • Python 3.11 以上和包管理器uv(安装方式见 uv 官方说明)。
  • 一个 LLM API Key,写稿依赖大模型。预设里有通义千问、GPT、DeepSeek、本地 Ollama,挑你手头有的。

Windows 用户可以直接跳过环境准备:从项目发布页下载 Windows 整合包,解压后双击start.bat即可启动,依赖全部内置。

按下面 4 步走:

  1. 克隆仓库并进入目录:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video
  1. 一条命令启动:uv run streamlit run web/app.py。uv会自动建虚拟环境并装完依赖,首次拉包稍慢,耐心等它结束。
  2. 浏览器自动打开http://localhost:8501,展开左侧「⚙️ 系统配置」面板。
  3. 在 LLM 配置的下拉菜单选一个预设(地址和模型名会自动填好),粘贴你的 API Key,点「保存配置」。

成功信号:浏览器出现三栏界面——左栏内容输入、中栏语音与视觉配置、右栏生成和预览,且配置面板提示保存成功。

能力版图:先试这 4 种用法

  • 批量出科普口播:输入一个主题,直接拿到带解说、配图的成片。没有剪辑经验的人,做一条视频的成本降到了打一句话。
  • 拿现成稿件直接口播:「固定文案内容」模式可粘贴已有文字,按段落、行或句子拆分。稿件质量有保障时,排版完全可预期,不必赌 AI 改写。
  • 自己的照片视频变短片:自定义素材模式上传你拍的照片或视频,AI 先分析内容再写脚本。旅行素材不补拍也能变成带解说的成片。
  • 用自己的声音配音:选 Index-TTS 这类支持克隆的工作流,上传一段参考音频,成片旁白就是那个音色。系列视频能保持统一的声音标识。

每条片默认切成 5 个分镜,对应 5 段画面。

配置决策:直接影响成片的 3 个开关

配图从哪条路线来

三条路线按硬件和预算二选一:

  • 本地 ComfyUI + selfhost 工作流:有 NVIDIA 显卡且已部署 ComfyUI 就选它,出图最快、不花 API 费用,工作流文件在 workflows/selfhost/ 下。
  • RunningHub 云端:没有显卡就选runninghub/...开头的默认工作流,再到系统配置面板填 RunningHub API Key,本地什么都不用装。
  • 直连供应商 API:只有 DashScope、OpenAI、Seedream、Kling 之类的云密钥时,选api/...工作流,在api_providers里填对应供应商的凭据。

坑:selfhost 服务没起来或模型文件没下载,进度会一直停在「生成配图」不走。开始前先点「测试连接」确认服务可达。

解说音:默认音色还是克隆音色

开箱就用,保持默认 Edge-TTS 即可,零配置、音色选择多。想要自己的声音,换 Index-TTS 并上传一段人声清晰的 MP3,先点「预览语音」试听再正式生成——试听是验证效果成本最低的动作。

坑:克隆只在 Index-TTS 这类支持的工作流里生效,选了 Edge-TTS 再传参考音频不会有任何作用。

模板:按画幅和背景类型选

模板集中在 templates/ 目录,按尺寸分竖屏 1080x1920、横屏 1920x1080、方形 1080x1080 三组,文件名前缀说明背景类型:static_*纯文字,不需要 AI 媒体、最省钱;image_*用 AI 图片做背景;video_*用 AI 视频做背景,最重。发 B 站、YouTube 选横屏组,发抖音、小红书选竖屏组。比如黑底电影质感的image_film,适合解说类内容:

坑:自制模板时,HTML 里 body 的宽高必须和所在分组一致(竖屏目录写 1080 × 1920),否则文字会顶出画面。

实战走查:一条横屏科普片,约 3 分钟出片

目标是做一条横屏科普,主题选「黑洞的形成原理」。选具体知识点而不是「宇宙」这种大词,是因为 LLM 写出的分镜更聚焦,配图也更容易扣题。

  1. 输入主题。左栏「内容输入」选「AI 生成内容」,填主题,分镜数保持默认 5。
  2. 中栏基本不动。TTS 留默认 Edge-TTS,挑一条发音清晰的音色;图像工作流保持默认的runninghub/image_flux.json,它走云端,本地无需任何准备。
  3. 挑模板。选横屏 1920x1080 组的image_wide_darktech,16:9 适合长视频平台,暗色科技风也压得住黑洞这种题材:

  1. 点「生成视频」🎬。进度按「生成文案 → 分镜 N/5 生成配图 → 合成语音 → 合成视频」推进,5 个分镜全程约 2-5 分钟。盯一下进度条:哪个分镜编号长时间不动,瓶颈就在哪一步。
  2. 收片。合成完成后右栏自动播放,显示时长、文件大小和分镜数;视频文件落在output/文件夹,历史页面里随时能再打开。

排障:5 个常见失败

  • 症状:进度停在「生成配图」,提示连接超时。→原因:本地 ComfyUI 没启动或地址配错。→解法:先确认浏览器能打开http://127.0.0.1:8188,再回配置面板重测连接。
  • 症状:文案生成不出来,弹窗报错。→原因:API Key 不完整、余额不足或网络不通。→解法:重抄一遍 Key 核对字符;用 Ollama 时确认服务已启动且模型已拉取。
  • 症状:uv run阶段依赖反复装失败。→原因:包缓存损坏。→解法:执行uv cache clean,再跑uv sync重装。
  • 症状:配图风格和模板不搭。→原因:提示词前缀写了中文,或尺寸超出模型支持范围。→解法:前缀改成英文风格描述,宽高控制在 1024x1024 附近。
  • 症状:生成耗时明显变长。→原因:分镜数多,或撞上云端 API 高峰。→解法:调少分镜数;有本地 GPU 就切 selfhost 工作流。

从「输入一个主题」到「拿到一条成片」,这套流程被压缩成了一次点击:写稿、配图、配音、合成全部由机器完成。生成完第一条视频后,可以去 docs/zh/ 中文文档里找自定义视觉风格、声音克隆的分场景教程继续往下试;想理解各环节怎么运转,workflows/ 目录下的 JSON 工作流文件就是最直接的答案。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询