Pixelle-Video 上手教程:一个主题到 AI 短视频成片的完整路径(附安装步骤)
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
Pixelle-Video 是一个开源的 AI 短视频生成引擎:输入一个主题,它自动完成文案撰写、AI 配图、解说合成、BGM 混入到成片合成的全流程。读完这篇 Pixelle-Video 上手教程,你就能在自己的机器上搭起本地服务,产出第一条成片 AI 短视频。
它是怎么成片的:从主题到视频的四个环节
文案与分镜:大语言模型(LLM)根据你的主题写解说词,并默认拆成 5 个分镜(分镜是视频的叙事单元,一个分镜对应一句解说和一张画面)。模型在左侧「⚙️ 系统配置」面板选择,兼容任何 OpenAI SDK 格式的接口,通义千问、GPT、DeepSeek 和本地 Ollama 都能接;已有现成稿件时,在「内容输入」切到「固定文案内容」模式,可按段落、按行或按句子拆分。
AI 配图:每个分镜都会自动生成一张配图,作为该镜头的视觉底。路线在中间栏「图像生成」下拉菜单里选,默认尺寸 1024×1024,整体画风由提示词前缀控制(前缀要求英文写法)。
解说与背景音乐:解说词交给 TTS(文本转语音)引擎读出,同时可以叠一层 BGM。TTS 工作流在中间栏「语音设置」里选,BGM 在左栏内容输入区选择。
模板合成:HTML 模板定义每一帧的排版,文字与配图注入模板逐帧渲染,最后连同音频交给 ffmpeg(视频处理工具)合成成片。输出统一落在根目录的output/文件夹。
一条命令在本地跑起来
前提只有一个:系统装好 ffmpeg,且 Python 版本不低于 3.11。macOS 执行brew install ffmpeg,Ubuntu/Debian 执行sudo apt install ffmpeg,装完用ffmpeg -version确认有输出。然后执行下面三条命令,完成 Pixelle-Video 安装并启动:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.pyuv(快速的 Python 包管理器)会自动创建虚拟环境并安装全部依赖,环境不用你管。Windows 用户可以直接下载官方整合包,双击start.bat启动,跳过以上步骤。启动成功后浏览器会自动打开 http://localhost:8501,看到三栏布局的 Web 界面即代表部署成功。
🎬 生成第一条成片:只需要做3个设置
设置一:填 LLM 密钥。展开左侧「⚙️ 系统配置」面板,在 LLM 配置里从下拉菜单选一个预设模型(如通义千问),粘贴你的 API Key,点「保存配置」。
设置二:填一个具体主题。在「内容输入」选择「AI 生成内容」模式,输入主题,比如「为什么要养成阅读习惯」。具体的知识点比「宇宙」这类大词效果好,因为 LLM 拆出的分镜更聚焦、配图更好生成。
设置三:其余保持默认,点生成。中间栏保持默认即可(TTS 走 Edge-TTS,图像走默认云端工作流),在「视频模板」里选一个竖屏 1080×1920 的模板,右侧点「生成视频」。进度按「生成文案 → 分镜生成配图 → 合成语音 → 合成视频」推进,默认 5 个分镜大约等 2-5 分钟。完成后右栏自动播放,显示时长、文件大小和分镜数,视频文件保存在output/,历史页面里也能再次查看。
图注:Pixelle-Video 的三栏 Web 界面,左栏输入主题与 BGM,中栏配置语音与视觉,右栏生成并预览成片。
调整成片效果:三个大旋钮
配图路线怎么选
当你觉得出片速度或成本不合适时,第一个要动的是它。在中间栏「图像生成」下拉菜单里选路线,同时在「⚙️ 系统配置」填好对应的密钥:
| 路线 | 速度与成本 | 硬件与前置要求 |
|---|---|---|
| 本地 ComfyUI(selfhost 工作流) | 最快且免费 | 需要 NVIDIA 显卡并本地部署 ComfyUI |
| RunningHub 云端工作流 | 中等,按云端用量付费 | 只填 RunningHub API Key,本地零部署 |
| 直连云端 API(DashScope、OpenAI、Kling 等) | 取决于供应商,按量付费 | 在api_providers填对应供应商密钥 |
选 selfhost 工作流的话,先确认本地 ComfyUI 已启动、对应模型文件已下载,并点「测试连接」确认能访问默认地址http://127.0.0.1:8188,否则生成会卡在配图步骤。
模板怎么选、怎么改
当成片版式、字体和平台气质不符时,换模板。templates/ 目录按尺寸分成三个子目录:竖屏1080x1920、横屏1920x1080、方形1080x1080;文件名前缀表示画面类型:static_*是纯文字模板,image_*用 AI 图片做背景,video_*用 AI 视频做背景。
模板本质是 HTML + CSS,内容通过 Jinja2 变量{{ title }}、{{ text }}、{{ image }}注入。想做自己的风格,就是做 Pixelle-Video 模板自定义:复制templates/1920x1080/下任意一个模板,改样式后存为.html放回对应尺寸目录,它会自动出现在模板下拉列表里。记住一条硬规则:模板body尺寸必须与所在目录一致(竖屏目录写1080px × 1920px),否则文字排版会溢出画面。
图注:1920×1080 的「Wide Darktech」模板预览,暗色科技风,适合科技与科普类横屏内容。
解说与背景音乐
解说质量取决于 TTS 工作流和参考音频。中间栏「语音设置」默认是 Edge-TTS,想换音色可切到 Index-TTS 等支持声音克隆的工作流:上传一段清晰的人声 MP3 作参考音频,生成的旁白就是那个音色。注意声音克隆只在支持的工作流下生效,选了 Edge-TTS 时上传参考音频不会有任何作用。点「预览语音」可以先试听,这是验证效果成本最低的方式。BGM 除内置曲目外,自定义音乐必须手动把 MP3/WAV 文件放进根目录bgm/文件夹,才会出现在列表里。
常见问题速查
| 现象 | 可能原因 | 解决办法 |
|---|---|---|
| Web 界面启动报错或打不开 | ffmpeg 未安装,或 Python 低于 3.11 | 装 ffmpeg 并用ffmpeg -version验证;依赖安装失败时执行uv cache clean重新安装 |
| ComfyUI 连接失败 | 本地 ComfyUI 未启动或 URL 配错 | 确认浏览器能访问http://127.0.0.1:8188,再到配置面板点「测试连接」 |
| LLM 调用失败,文案生成不出来 | API Key 有误、余额不足或网络不通 | 核对系统配置面板中 Key 是否完整;用本地 Ollama 时确认服务已启动且模型已拉取 |
| 配图风格和模板不搭 | 提示词前缀用了中文,或图像尺寸超出模型支持范围 | 前缀写英文风格描述,宽高在模型允许范围内调整 |
| 生成速度慢 | 分镜数量多,或高峰期走云端 API | 把分镜数从默认 5 调少;有本地 GPU 时改用 selfhost 工作流 |
| 上传参考音频后音色没变 | 所选 TTS 工作流不支持声音克隆 | 切换到 Index-TTS 等支持克隆的工作流,再重新上传参考音频 |
接下来
- docs/zh/ 中文文档:有自定义视觉风格、声音克隆等分场景教程,生成完第一条视频后照着往下试即可。
- workflows/selfhost/ 与 workflows/runninghub/ 目录:查看可替换的图像、视频与 TTS 工作流,想加新模型就往里放。
- config.example.yaml:配置文件模板,
llm、api_providers、template等字段都能在这里对照修改。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考