Pixelle-Video:输入一句话主题,自动配图文和配音的AI短视频成片自己跑出来
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
在「内容输入」框敲下「为什么要养成阅读习惯」,点「生成视频」,转身去倒杯咖啡。回来时,文案、配图、解说、合成四段进度条已依次走完,output/目录里躺着一支竖屏成片:水墨山峦做画面,沉稳的嗓音在念稿,底下压着一段轻 BGM。这就是Pixelle-Video,一个 AI 全自动短视频生成引擎,的日常使用画面。先把最劝退的环境问题交代清楚。
没装过开发环境?三行命令跑起AI短视频引擎
Windows 用户最省事:下载官方整合包,解压后双击start.bat,浏览器会自动打开http://localhost:8501,Python、uv、ffmpeg全都打包在里面,不用手动装任何依赖。
macOS 或 Linux 用户先装好uv和ffmpeg,然后在终端执行:
git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video uv sync uv run streamlit run web/app.py首次运行时展开「⚙️ 系统配置」面板,你只需要填一个 LLM 密钥——通义千问、GPT、DeepSeek、Ollama 都认,选预设会自动填好模型地址。图像生成用默认的 RunningHub 云端即可,不需要本地显卡。你只负责「填密钥」和「敲主题」两件事,剩下它自己跑。
从一句话到分镜:AI自动生成短视频脚本
主题交出去之后,大模型产出的不只是一段解说词,它顺手把分镜切好了——每个分镜对应一段画面,后面的配图和配音都由这份脚本驱动。做知识科普类内容,这里藏了个小技巧:把 LLM 的temperature调低一些,输出会更克制、更有条理,适合需要严谨结构的选题。
已经有成稿的话,直接走「固定文案」模式:整段贴进去,分割方式支持按段落、按行、按句子三种,选按句子切,每一句配一张图,画面切换更密集,短视频的节奏感一下就上来了。
💡 固定文案模式下,一句话就是一张图。想让解说不断句,就把句子写短一点。
画面交给模板:从静态配图到动态短片
系统会给每个分镜自动生成一张 AI 插画,风格完全跟着你选的模板走。templates/目录按分辨率分了三档:竖屏 1080x1920、横屏 1920x1080、方形 1080x1080,Web 界面里有模板预览,先看效果再决定,不用凭文件名盲猜。image_book.html的书卷气质压得住知识科普,image_film.html的黑底横版则更像正片。
说白了,模板就是一套 HTML 布局文件,文字位置、背景、排版都由它决定,想调整风格改改样式就行。如果静态图还不够带感,把图像生成切换到 WAN 2.1 这类视频模型,每个分镜的画面就真正动起来,图文视频升级成动态短片。
配音与BGM一次配齐:还能克隆你自己的声音
TTS 环节内置了 Edge-TTS、Index-TTS 等主流方案,下拉选一个,旁白就自动配好了,点「预览语音」还能先试听。想要更有辨识度,上传一段10-30 秒的清晰人声做参考音频,选支持克隆的工作流(如 Index-TTS,Edge-TTS 不支持),系统就能克隆这个音色——做系列内容时,每条视频都带着同一个"个人声音"。
BGM 同样不操心:内置音乐直接选,也可以把自己的音频文件放进bgm/文件夹,界面上就会出现可选项,点「试听 BGM」确认一下再开始生成。
一晚跑完十条:批量模式的点菜清单
批量模式是这台引擎真正的效率放大器。勾选「批量生成模式」,每行写一个主题,最多 100 个,所有视频共用同一套配置,开跑前页面会先给出预估总耗时。照着抄就能跑的一份清单:
- 模式:AI 生成内容 + 批量模式
- 主题:10 行,每行一个,比如「居家训练」系列十条
- LLM:通义千问
- 图像:RunningHub 云端,按量付费
- TTS:Edge-TTS
- 模板:竖屏
image_modern.html(1080x1920,适配抖音和视频号) - BGM:内置音乐
算笔账:十条视频手动拍摄剪辑,工作量通常是几天起;批量模式下,一个晚上排完队就能收工。成本上,云端图像按张计费,加上每条视频几次 LLM 调用,总花费远低于一天的人工。批量生成期间保持页面打开,跑完的成片会统一进「📚 历史记录」页,方形模板image_minimal_framed.html这类 1080x1080 规格也适合需要多平台铺开的场景。
没有独立显卡?挑一条适合自己的路
两条路径,按机器选。
只有一台普通笔记本:文案走 API,图像走 RunningHub 云端按调用付费,配音用 Edge-TTS——全程不占本地显卡,照样出片。数据默认存在本地output/目录,只有调用云端 API 时才发送必要内容。
手里有 NVIDIA 显卡:LLM 切到本地 Ollama,图像生成指向本地 ComfyUI(默认http://127.0.0.1:8188),语音用 Edge-TTS。整套流程 API 费用为零,数据全部留在本机,连"数据出境"的顾虑都省了。
几个大家都会犹豫的问题
完全没剪辑经验,能上手吗?能。整个流程被抽象成「输主题—选模板—点生成」,全部操作在浏览器里完成,不接触任何剪辑软件和代码。
生成一支视频要等多久?常见耗时几分钟,主要取决于 LLM 响应速度、图像生成的排队情况和网络状况;批量任务会依次排队,开跑前还会显示预估总耗时。
数据会被上传到第三方吗?数据默认保存在本地output/目录,只有调用云端 API 时才会发送必要数据;走本地 Ollama + ComfyUI 路线,可以做到数据完全不出本机。
能商用吗?项目采用 Apache License 2.0 协议,可以自由使用与二次开发,个人创作者和中小团队都能直接搬进自己的内容生产线。
视频制作里最硬的那块环节被拆掉了,剩下选题、表达和对画面的判断,这些是你的主场。你第一个要生成的主题,想好了吗?
【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考