一句话AI视频生成:Pixelle-Video约4分钟产出完整短视频
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
周四产品评审会前30分钟,运营需要一条60秒的新功能介绍视频。Pixelle-Video 是一套AI视频生成引擎:输入一句话主题,它会自动产出文案、配图、旁白与背景音乐齐全的成品短视频。官方口径,默认5个分镜的生成耗时约2至5分钟,中位数落在4分钟左右,全程不需要拖时间轴或对帧。
🧩 拆能力链路:从输入到成片
这条AI视频生成流水线可以压缩成一句话:一个主题进,一条成片出。逐环节拆开看:
- 内容环节:LLM把主题拆成标题加每分镜一句旁白,写稿环节不再靠手
- 视觉环节:每个分镜由图像生成模型(ComfyUI工作流或直连API)产出对应配图
- 语音环节:Edge-TTS直接合成旁白音频,也可切到ComfyUI的TTS工作流支持声音克隆
- 封装环节:HTML模板把图、字、音频排好版,再经 ffmpeg 拼接、叠BGM导出成片
各环节能力可独立替换,换模型、换工作流、换模板,链路骨架不变。这是它能被深度定制的原因。
🎬 跑通第一条成片
最简安装步骤(3条命令)
前置环境需要两样:Python包管理器 uv 和视频工具 ffmpeg。装好后执行:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video ./start_web.sh浏览器会自动打开 http://localhost:8501。Windows 用户直接解压官方整合包、双击 start.bat 即可,跳过以上命令。
只填两项必填配置
首次运行展开「⚙️ 系统配置」面板,只有两处必填:
- LLM 配置:预设下拉选一个模型(通义千问、GPT、DeepSeek、Ollama 等),填入对应api_key
- 图像生成配置:本地 ComfyUI 填comfyui_url(默认 http://127.0.0.1:8188),用 RunningHub 则填runninghub_api_key
填完点「保存配置」。注意 LLM 的api_key、base_url、model三个字段任何一个为空,配置校验都不会通过,生成无法启动——这是首次"跑不起来"最常见的原因。
走一遍工作流四环节
内容生成:用分镜滑杆定长短
分镜滑杆范围3至30,默认5。一个分镜对应一句旁白加一张配图,直接决定成片时长与总耗时。60秒左右的成片,5到6个分镜通常够用;拉得过大,多出来的是等图生成的时间。
视觉合成:提示词前缀定整体调性
prompt_prefix是拼在每张配图生成提示词前面的英文风格前缀,默认值是黑白火柴人风格。改成 "cinematic lighting, film still" 之类,整片调性随之切换,无需逐句改提示词。图像尺寸默认1024x1024,在视觉设置栏可调宽高,不同模型对尺寸上限限制不同。
语音合成:TTS音色与语速怎么调
本地模式用 Edge-TTS,走在线服务无需密钥。默认音色为男声zh-CN-YunjianNeural,speed取值0.5至2.0,默认1.2。觉得播音偏快,降到1.0再试听;设置栏提供「预览语音」按钮,先测试再正式生成。
成片封装:模板与背景音乐
模板都在 templates 目录 下,按1080x1920竖屏、1920x1080横屏、1080x1080方形分组。命名前缀即类型:static_纯文字不出图,image_配图,video_动态视频。BGM 默认关闭,换自有曲目需把文件放进 bgm/ 文件夹。成片落在 output/ 目录,右侧栏可直接播放。
🎛️ 调优三层参数
第一次跑通之后,所有改进都可以归到三层,每层改动互不影响,返工成本低。
文案层:换 LLM 预设(千问与 GPT 的文风差异明显)、分镜滑杆从5拉到8、手动指定标题字段。已有现成稿时,把内容输入切到「固定文案」模式,一行一个分镜,还可选按段落、行或句子切分。
视觉层:整体风格靠prompt_prefix换,图像尺寸微调清晰度,平台按尺寸选模板——竖屏1080x1920、横屏1920x1080。模板预览按钮可以先调参数看效果再正式生成,试错代价低。
语音层:换音色(晓晓、云健、云希等,完整列表见 pixelle_video/tts_voices.py)、微调speed,或切 ComfyUI 模式用 Index-TTS 工作流,上传一段参考音频克隆自己的声音。
踩坑实录三份笔记
以下三个问题都是实测中真实遇到的,各自花了几轮才解决。
坑一:成片"差一口气"。当时以为是模型能力问题,实际是分镜默认5个。每句旁白约5至20字,总时长由分镜数决定。滑杆拉到8,片长约多出30秒;反过来做30秒短片,拉到3即可。
坑二:连续三个分镜的配图画风漂移,一个水墨、一个3D、一个照片。原因是单句提示词只承载场景描述,模型只能自由发挥。解法用prompt_prefix锁死风格后重新生成;同时核对所选图像工作流是否一致(config.yaml 中 image 下的default_workflow)。
坑三:播音偏赶,句尾吞字。speed1.2 对资讯类播报确实偏快,降到1.0并换成女声后试听过关。若 TTS 服务偶发无返回,直接重启服务;项目已锁定 edge-tts 版本修复过这类不稳定。
方形成片适合信息流投放,同一份文案把模板换成1080x1080重新生成即可:
🧾 算月成本账
三种方案组合如下(数字为估算区间,实际以 API 调用量与图、视频生成条数为准):
| 方案 | 月均成本 | 适用场景 |
|---|---|---|
| 本地全免费:Ollama + 本地ComfyUI + Edge-TTS | 约0元(电费除外) | 有本地显卡、日常高频生成 |
| 云端按需:通义千问 + RunningHub + Edge-TTS | 约20至80元/月,随条数浮动 | 无本地显卡、每周中等产量 |
| 混合:平日本地、高峰与高质量走云端 | 约0至40元/月 | 预算紧、产量弹性大 |
RunningHub 排队久是并发限制在起作用:config.yaml 里runninghub_concurrent_limit可设1至10,默认1,调高可提升批量任务的实际吞吐。
找延伸入口
- 官方文档中文总入口:安装、配置参考、FAQ 都在这里,界面行为与预期不符时先查这里
- 模板手册:自建模板与预览方法,配合格式说明逐项过一遍
- workflows 目录:runninghub/ 与 selfhost/ 子目录内置图像、视频、TTS 工作流,自己导出的 ComfyUI JSON 放进去即可出现在下拉列表
今晚就能做的第一件事:启动服务,输入一个15字以内的主题,分镜滑杆保持5,模板选默认,点生成。泡一杯咖啡的时间,output/ 里会躺着一条60秒左右的成片;明天再按三层调优法各动一个参数,对比差异。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考