Pixelle-Video:全自动AI短视频生成
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
项目速览
Pixelle-Video 是一个开源的 AI 短视频生成引擎,采用 Apache 2.0 协议。它的思路很直接:输入一个主题,它自动完成文案撰写、AI 配图、语音合成、视频合成四个环节,输出一条成品短视频,全程不需要剪辑软件。底层通过大模型加 ComfyUI 工作流或直连模型 API 驱动,一条 3-5 分镜的视频通常 2-5 分钟即可生成完毕。
适合谁用:
- 想批量生产科普、解说类短视频的自媒体创作者
- 希望把文案、配音、合成串成流水线的内容团队
- 想在模板体系和工作流之上做二次开发的开发者
3 条命令跑起 AI 视频生成
前置环境需要 Python 3.11+、包管理器 uv 和 ffmpeg(视频合成依赖),装好后只需:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video && cd Pixelle-Video uv run streamlit run web/app.py浏览器会自动打开 http://localhost:8501 的三栏 Web 界面。首次运行要配置一次「⚙️ 系统配置」面板:LLM 的 API Key 必填(负责写文案);配图环节三选一——本地 ComfyUI 地址、RunningHub 云端 Key、或直连模型 API(DashScope、OpenAI 等)。所有配置项在 config.example.yaml 里有完整注释,复制为 config.yaml 按示例填写即可。Windows 用户也可以直接下载项目提供的整合包,免装环境。
AI视频生成的核心能力拆解
一个主题驱动的完整流水线
是什么:从单一主题自动产出成品视频。怎么实现:先由 LLM 把主题展开成文案并拆分成镜,每个分镜对应生成配图或视频片段、合成解说音频,再逐帧套入 HTML 模板渲染合成。用户侧能做什么:在内容输入区选择「AI 生成内容」(AI 写稿)或「固定文案内容」(用现成脚本跳过写稿),并配置背景音乐——内置音乐直接选,自定义音乐丢进 bgm/ 目录即可。
可插拔的 AI 能力层
是什么:图像生成、视频生成、TTS、素材分析四类原子能力都可独立替换。怎么实现:统一抽象成「工作流」,既支持 ComfyUI(本地 selfhost 或 RunningHub 云端),也支持直连模型 API,包括 DashScope Wan、OpenAI GPT Image、Seedream、Seedance、Kling 等供应商。用户侧能做什么:在 Web 界面下拉切换图像/视频/TTS 工作流;使用 Index-TTS 等支持克隆的工作流时,上传一段参考音频即可用你的音色做解说,并支持试听预览。
HTML 模板系统
是什么:模板决定视频画面的布局与风格。怎么实现:每个模板是一个 HTML 文件,负责排版文字、叠加图片或视频;按命名区分 static_(纯文字,不需要 AI 素材)、image_(AI 配图做背景)、video_*(AI 视频做背景)。内置 31 个模板:
| 模板尺寸 | 数量 | 典型用途 |
|---|---|---|
| 1080x1920 竖屏 | 25 | 抖音、小红书等短视频平台 |
| 1920x1080 横屏 | 5 | B站、YouTube 等长视频平台 |
| 1080x1080 方形 | 1 | 方形图文帖 |
所有模板都能在生成前点击「预览模板」查看效果,并可自定义参数测试。
架构设计解读
顶层目录结构:
Pixelle-Video/ ├── pixelle_video/ # 核心库:pipelines/services/models/config ├── web/ # Streamlit 三栏 Web 界面 ├── api/ # FastAPI 接口层(routers/schemas/tasks) ├── templates/ # HTML 视频模板,按尺寸分目录 ├── workflows/ # ComfyUI 工作流 JSON,分 runninghub/ 与 selfhost/ └── config.example.yaml几个关键设计决策:
- 分层清晰:Web 层只做交互,业务逻辑收敛在服务层,所有 AI 生成动作被抽象为「工作流」,换模型供应商不影响上层流程。
- 流水线模式:pixelle_video/pipelines/ 下定义了 base、standard(从零创作)、custom(固定脚本)、asset_based(用户上传素材)等流水线,新增一种生成策略只需加一个子类。
- 能力外置:工作流全部是 workflows/ 下的 JSON 文件,模型供应商凭据集中在配置文件的 api_providers 段落声明,代码与模型解耦。
如果要二次开发:加视觉模板就往 templates/ 里放一个 HTML 文件;加生成策略改 pixelle_video/pipelines/;接新的模型供应商在 pixelle_video/services/api_services/ 增加对应 client 即可。
进阶用法与调优
- 场景:首次上手想最快出片 →建议:选 static_* 纯文字模板,完全不需要 ComfyUI 和图像 API →预期效果:流程只剩文案和合成,速度最快,适合先跑通再换重模板。
- 场景:配图风格杂乱不统一 →建议:在配置里设置图像 prompt_prefix(需英文),并用「预览风格」按钮先测试 →预期效果:全片配图保持同一画风,观感一致。
- 场景:希望视频用本人音色解说 →建议:上传参考音频并选支持克隆的 TTS 工作流(如 Index-TTS) →预期效果:解说音色与参考音频一致,适合个人 IP 账号。
- 场景:使用 RunningHub 云端并发批量出片 →建议:按账号档位把 runninghub_concurrent_limit 调到 1-10 之间 →预期效果:在限流内最大化吞吐量,多任务并行不再排队。
- 场景:预算敏感、追求零成本 →建议:LLM 用 Ollama 本地模型,配图用本地 ComfyUI →预期效果:按项目 FAQ 的数据,单视频成本 0 元。
三种典型部署方式对比:
| 方案 | 依赖 | 成本 |
|---|---|---|
| 完全本地 | Ollama + 本地 ComfyUI | 0 元 |
| 推荐方案 | 通义千问 + 本地 ComfyUI | 约 0.01-0.05 元/视频 |
| 全云端 | OpenAI + RunningHub | 费用较高,但无需本地环境 |
常见问题:
- Q:必须部署 ComfyUI 吗?不是。纯文字模板完全不需要;要 AI 配图又不想本地部署,可用 RunningHub 云端或直连 API。
- Q:第一次生成要等多久?3-5 分镜的视频约 2-5 分钟,取决于分镜数、网络和推理速度。
- Q:效果不满意怎么调?依次尝试:换 LLM 模型、调整图像尺寸与提示词前缀、换 TTS 工作流、换模板。
AI视频生成的三个实战场景
知识科普类自媒体运营者,每天从选题库里挑一个主题输入,选一个竖屏模板,几分钟内拿到一条「文案+配图+解说」的成品视频直接发布。结合历史页面的批量任务能力,可以一次排期多个主题,日更账号的产能压力明显降低。
教育机构的课程推广团队,选择「数字人口播」流水线,上传讲师的语音样本用于音色克隆,输入课程卖点文案,系统产出虚拟人口播视频;再借助内置的多语言音色(覆盖中、英、韩、俄、法、西、德、葡、土等 10 种语言)为海外用户制作不同语言版本,一次创作多地上线。
手握既有素材的内容团队,进入「自定义素材」流水线,上传产品照片或既有视频片段,AI 会自动分析素材内容并生成匹配的脚本与解说,原有素材直接成为视频主角,避免了纯 AI 生成内容风格割裂的问题。
生态与参与
README 的更新日志记录了 2025-11 至 2026-06 之间 12 次连续迭代,涵盖动作迁移、数字人口播等新流水线和多模型供应商支持,项目处于高频更新状态。参与入口有两条:问题反馈和功能建议走仓库 Issue;贡献流程与代码规范见 docs/zh/development/contributing.md。使用文档、模板说明和故障排查集中在 docs/(中文在 docs/zh/ 下);想理解模板体系,建议直接看 templates/ 里的 HTML 示例和命名约定,从复制一个现成模板改起最快。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考