Pixelle-Video:一个主题如何变成成片?AI全自动短视频引擎上手指南
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
你手里有个不错的选题,但脚本没人写、配图没人找,剪一条片又要大半天。Pixelle-Video 把这条链路收进了一个动作:输入主题,它自动完成文案创作、AI 配图、语音解说和视频合成,几分钟后就能在浏览器里看到成片。它适合想持续产出内容却没有剪辑经验的人——自媒体作者、知识分享者、电商运营,或者只是想把想法拍成视频的你。
一分钟看懂 Pixelle-Video 能帮你做什么
简单说,Pixelle-Video 是一个"主题进、视频出"的流水线。你负责给出一个词,剩下的分工它都做好了:
- 文案:LLM 按主题生成解说词,也可以贴入你自己写好的固定文案
- 画面:每个分镜自动配 AI 插图,也能用 AI 视频模型做动态背景
- 声音:多种 TTS 方案可选,还支持上传参考音频做声音克隆
- 成品:自动加 BGM、套模板、合成导出,文件落在output/目录
它的关键卖点有三个:全流程不用打开剪辑软件;各环节(模型、TTS、工作流、模板)都能单独替换;本地有显卡可以零成本跑,没有显卡用云端也能跑通。
五分钟跑起来:安装、启动与首次配置
Windows:整合包最省事
下载 Windows 一键整合包并解压,双击目录里的启动脚本(start_web.bat),浏览器会自动打开http://localhost:8501。包里已经带了 Python、依赖和 ffmpeg,不需要你装环境。
macOS / Linux:两条命令装好前置
源码方式先准备uv(Python 包管理器)和ffmpeg:
sudo apt install ffmpeg # Ubuntu / Debian brew install ffmpeg # macOS然后克隆并启动:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.pyuv run会顺手装好全部依赖,启动后同样打开http://localhost:8501。
首次配置:只填三个地方
进入「⚙️ 系统配置」面板,填完保存就能用:
- LLM 配置:下拉选择预设模型(通义千问、GPT、DeepSeek、Ollama 等),自动带出base_url和模型名,填入 API Key
- ComfyUI / RunningHub:本地有 ComfyUI 就填地址(默认http://127.0.0.1:8188)并可点「测试连接」;没有显卡就填 RunningHub 的 API Key
- API 媒体模型(可选):想直连 DashScope、OpenAI、可灵、Seedance 这类供应商时再填
如果不用 Web 界面而想改配置文件,把config.example.yaml复制为config.yaml再填:
llm: base_url: "https://dashscope.aliyuncs.com/compatible-mode/v1" model: "qwen-max"更多细节可以看 快速开始文档。
功能巡礼:四个核心能力逐个看
能力一:AI 写稿,也能接你的稿
能做什么:输入"为什么要养成阅读习惯"这样的主题,AI 会生成结构完整的解说词,并按分镜切好;如果你已有成稿,选「固定文案内容」,支持按段落、按行、按句子三种方式分割,每段对应一个画面。
怎么开:左侧栏「📝 内容输入」里切换模式即可。
效果示例:输入"为什么我们还没有找到外星文明",默认 5 个分镜,几分钟得到一条带画面和配音的科普短视频。
能力二:声音合成与声音克隆
能做什么:内置 Edge-TTS、Index-TTS 等 TTS 工作流,支持多语言音色;上传一段 10–30 秒的参考音频,就能克隆特定人的声音来配音。
怎么开:中间栏「🎤 语音设置」选 TTS 工作流;要克隆就上传 MP3/WAV/FLAC 参考音频,点「预览语音」先试听再正式生成。
效果示例:用 Index-TTS 加一段自己的录音做参考,生成的"个人成长"类内容听起来像本人在讲述。教程见 声音克隆。
能力三:AI 配图与动态视频背景
能做什么:每条分镜文案都会生成一张匹配插图;选video_*.html模板时还能调 AI 视频模型(如 WAN 系列)生成动态背景。生成途径有三条:本地 ComfyUI 工作流、RunningHub 云端工作流、直连模型 API。
怎么开:中间栏「🎨 视觉设置」里选工作流(selfhost/是本地、runninghub/是云端、api/是直连供应商),可调图像尺寸(默认 1024x1024)和英文提示词前缀来统一画风,点「预览风格」先测一张。
效果示例:提示词前缀写成"黑白火柴人简笔画风格",整条视频的画面就会是这个调性,风格高度统一。
能力四:模板库与 BGM,成品感的来源
能做什么:模板分三类——static_*.html纯文字样式、image_*.htmlAI 图片做背景、video_*.htmlAI 视频做背景,覆盖竖屏(1080x1920)、横屏(1920x1080)、方形(1080x1080)三种尺寸,直接对应该发抖音、B站还是 Instagram。BGM 支持无、内置音乐、自定义音乐三种,自定义文件放进bgm/文件夹即可,还能在线试听。
怎么开:模板下拉框按尺寸分组,点「预览模板」可自定义参数看效果。
效果示例:同一个主题分别套横屏电影感模板和方形模板,发布到不同平台就是两条风格匹配的内容。
三个真实场景:目标、操作要点、结果预期
场景一:知识科普账号日更
- 目标:每天稳定产出一条 1 分钟科普视频,不请写手
- 操作要点:选「AI 生成内容」模式,把选题写具体一点(例如"反脆弱是什么意思");模板选
image_*.html系列;TTS 用清晰的教学音色;分镜数保持默认 5 个 - 结果预期:文案、配图、配音全部自动完成,一条 5 分镜视频约 2–5 分钟出片,选题库就是你的产能上限
场景二:电商产品与副业推广
- 目标:把卖点快速变成横屏推广片,投 B站或视频号
- 操作要点:主题里直接写进产品关键词和核心卖点;用「固定文案内容」模式贴审核过的卖点稿,按句子分割;模板选 1920x1080 横屏款;加一段节奏感强的 BGM
- 结果预期:文案经过你把关不会出现夸大表述,画面风格由提示词前缀统一,适合批量产出多条不同卖点的推广视频
场景三:个人 Vlog 与培训材料
- 目标:用自己的照片、视频素材做个性化内容
- 操作要点:使用「自定义素材」工作流,上传照片或视频,AI 会先分析素材再写匹配的解说词;语音选克隆音色让视频更像"你自己在讲";企业培训则固定一套模板和配色保持品牌一致
- 结果预期:素材、解说、配音三者对得上,个人内容有辨识度,培训片多期之间风格统一
常见坑:生成前先看这五条
Q1:必须本地部署 ComfyUI 吗?不一定。纯文字模板(static_*.html)完全不需要 AI 生图,生成飞快;要配图但不想部署,可以填 RunningHub 的 API Key 走云端。详见 FAQ。
Q2:跑一条视频要花多少钱?三档方案随你挑:Ollama 本地 LLM + 本地 ComfyUI,成本 0 元;通义千问 + 本地 ComfyUI,一条片几分钱量级;OpenAI + RunningHub 全云端,费用高但不用任何本地环境。有显卡选免费档,图省事选千问档。
Q3:ComfyUI 连接失败怎么办?三查:服务是否真的在跑、config.yaml里comfyui_url地址对不对(Docker 场景下 Mac/Windows 要用host.docker.internal:8188)、回到界面点一次「测试连接」。
Q4:LLM 调用失败或文案跑偏?先核对 API Key 与网络;跑偏就换个 LLM 模型试试,不同模型的文风差别不小,也可以把提示词前缀写得更具体。
Q5:语音听着不自然?换一个 TTS 工作流或音色;想更个性就上声音克隆,参考音频要清晰、10–30 秒、无背景噪音,否则克隆效果会打折。
进阶方向:哪里可以动手改
整个系统分三层:Streamlit 的 Web 层、核心服务层、ComfyUI/API 执行层,架构说明见 架构文档。想深挖时认准这几个入口:
- 服务模块:pixelle_video/services/,文案在llm_service.py,语音在tts_service.py,图/视频生成在media.py,合成在video.py
- 扩展流水线:web/pipelines/ 里的digital_human.py(数字人口播)、i2v.py(图生视频)、action_transfer.py(动作迁移)、asset_based.py(自定义素材)
- 工作流目录:workflows/ 下runninghub/放云端 JSON、selfhost/放本地 JSON,自己在 ComfyUI 里导出的工作流丢进去,界面就能选到
- 模板目录:templates/ 按分辨率分文件夹,会写 HTML 就能加自己的模板,规范见 模板指南
开始吧:三步行动清单
- 拿到项目:Windows 用户下载整合包解压即可;其他系统执行
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video并安装 uv 和 ffmpeg - 启动界面:运行
uv run streamlit run web/app.py(或双击整合包启动脚本),浏览器自动打开http://localhost:8501 - 配置并出第一条片:在系统配置里填 LLM API Key 和图像生成途径(本地地址或 RunningHub Key),保存;然后在内容输入框写一个选题,点「🎬 生成视频」
配置只填一次,之后的每次创作都只剩"输入主题"这一个动作。今天跑通第一条,明天就可以开始攒你的选题库。
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考