AI 短视频怎么一键出片:Pixelle-Video 本地部署实操
2026/9/8 16:46:08 网站建设 项目流程

AI 短视频怎么一键出片:Pixelle-Video 本地部署实操

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

需要定期发口播、书单号、科普号,但既没人写脚本,自己也不会剪辑的人,通常就卡在这一步。Pixelle-Video 就是为这种场景做的开源 AI 短视频生成工具:输入一个主题,它自动写文案、配 AI 插图、合成语音解说、加上背景音乐,最后拼成一条能直接发的短视频,全程不用碰剪辑软件。

从下载到出片的最短路径

Windows 用户有整合包,解压后双击 start.bat 即可,不用装 Python 和 ffmpeg。Mac 和 Linux 用户走源码路线:先拿到项目代码,再启动 Web 界面,这一步只花一分钟。

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.py

浏览器会自动打开 http://localhost:8501 的界面。真正需要你动手的只有两项关键配置:LLM 的 API Key(界面里选预设会自动填好 base_url 和模型名),以及图像生成服务的地址或 Key。其余项都可以先用默认值。

Web 界面左侧是主题输入、TTS、模板和插图设置,右侧点"生成视频"后直接预览成片

配好后在"内容输入"区填主题,选好模板,点"🎬 生成视频"。一条 1~2 分钟的视频大约 3~5 分钟出片,时间主要花在文案和配图生成上。详细步骤可对照安装文档。

四个环节各自能做什么

整条流水线是"文案生成 → 配图规划 → 逐帧处理 → 视频合成",每个环节都能单独换引擎,这张流程图说得很直白:

文案:主题进去,分镜脚本出来

能做什么:输入主题,LLM 自动写出带标题和旁白的分段脚本,每段旁白对应一个画面。例子:输入"如何增加被动收入",产出十几段口语化旁白,每段一句话左右,可以直接念。适合谁:有选题但懒得写稿的人,尤其是日更账号。模型在 llm_presets 里预置了通义千问、OpenAI、Claude、DeepSeek、Moonshot、Ollama 六种,都走 OpenAI 兼容协议,选哪个填哪个 Key 就行。

画面:每句旁白配一张 AI 插图

能做什么:每句解说词自动生成一张配图,套进 HTML 视觉模板。例子:用书籍风格模板做"资治通鉴"解说,每段旁白配一张水墨山水插图,画面统一。适合谁:书单号、知识科普号。模板目录 里按尺寸分了三档:1080x1920 竖屏、1920x1080 横屏、1080x1080 方形,共 20 多个模板。文件名即类型:static_*是纯文字卡不需要生成媒体,image_*用 AI 图片,video_*用 AI 视频做动态背景,选模板前先看平台要求哪种比例。

书籍风格横屏模板效果:AI 生成的水墨插图配大段解说字幕,适合深度内容

声音:TTS 配音,还能克隆音色

能做什么:把旁白转成语音,内置 Edge-TTS、Index-TTS 等多种方案,界面里选音色和语速,还能上传参考音频做声音克隆,让 AI 用你自己的音色念。例子:录 10 秒自己的声音,成片就是"你"在讲。适合谁:个人 IP 账号。音色列表维护在 tts_voices,工作流在 workflows 目录。

合成:帧、配音、BGM 拼成 mp4

能做什么:FFmpeg 把帧画面、配音、背景音乐按时间轴拼好,输出带片尾标识的成品 mp4。例子:界面右侧直接显示输出文件路径、时长和分辨率(如 1080x1920),点开就能看。适合谁:所有人,这步全自动。合成引擎在 services 目录,进阶能力也有现成流水线:数字人口播适合需要"真人出镜"的教育演示;图生视频能把静态图变成动态背景;动作迁移可上传参考视频让画面动起来。

电影风格横屏模板效果:黑底居中画面加标题字幕,适合影视解说类内容

部署方式和模型怎么选

零显卡路线:LLM 用云端 API(通义千问或 DeepSeek,官方说生成一条 3 段的视频约 0.01~0.05 元),图像走 RunningHub 云端算力,填个 Key 就能跑,机器要求几乎为零。有显卡路线:ComfyUI 本地部署(建议 NVIDIA 显卡 6GB 显存以上)加 Ollama 本地 LLM,一分钱不花,代价是装环境和下模型文件要折腾半小时。直连 API 路线:不走 ComfyUI 工作流,直接在界面配 DashScope、OpenAI、火山引擎 ARK、Kling 等供应商的 Key,省掉工作流这一层。所有能力都是可替换的"原子",图像、视频、TTS、VLM 各自独立选供应商,配置文件参考 config.example.yaml。

生成一个视频要多久?1~2 分钟的视频通常 3~5 分钟,瓶颈在配图数量,段落越多越慢。

实际使用中的 3 个坑

  1. 填完 Key 点生成报连接错误:多半是 base_url 没跟着预设走,单独手敲容易漏字符。解法:用预设下拉选模型,让界面自动填充地址。
  2. 本地 ComfyUI 出图卡在空提示:工作流跑通了但没图,因为模型文件没下。解法:按 ComfyUI 自己的文档下载对应模型,再用界面的"测试连接"确认。
  3. 竖屏成片发到横屏平台显得变形:默认模板是 1080x1920 竖屏,比例是模板定的。解法:选模板前先定平台,发 B 站、YouTube 就选 1920x1080 目录下那批模板。

完全免费到底能不能用?能,Ollama 加本地 ComfyUI 就是官方给出的零成本方案;图省事用云端 API,一条视频几分钱,比请人剪辑便宜几个量级。

现在就能做的 5 件事

  1. 下载Windows 整合包,或按上面的命令跑通源码版
  2. 界面里的 LLM API Key 和图像服务地址,先别管其他选项
  3. 生成第一条视频,主题随便填一个,比如"如何增加被动收入"
  4. 对比把竖屏、横屏模板各跑一遍,记下哪种风格像你账号的调性
  5. 一条带自定义素材的流程再跑一次,看看用自己图片生成的脚本效果

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询