☰
Pixelle-Video:输入一句话主题,自动配图文和配音的AI短视频成片自己跑出来
2026/10/7 2:40:05 网站建设 项目流程

Pixelle-Video:输入一句话主题,自动配图文和配音的AI短视频成片自己跑出来

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

在「内容输入」框敲下「为什么要养成阅读习惯」,点「生成视频」,转身去倒杯咖啡。回来时,文案、配图、解说、合成四段进度条已依次走完,output/目录里躺着一支竖屏成片:水墨山峦做画面,沉稳的嗓音在念稿,底下压着一段轻 BGM。这就是Pixelle-Video,一个 AI 全自动短视频生成引擎,的日常使用画面。先把最劝退的环境问题交代清楚。

没装过开发环境?三行命令跑起AI短视频引擎

Windows 用户最省事:下载官方整合包,解压后双击start.bat,浏览器会自动打开http://localhost:8501,Python、uv、ffmpeg全都打包在里面,不用手动装任何依赖。

macOS 或 Linux 用户先装好uv和ffmpeg,然后在终端执行:

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video uv sync uv run streamlit run web/app.py

首次运行时展开「⚙️ 系统配置」面板,你只需要填一个 LLM 密钥——通义千问、GPT、DeepSeek、Ollama 都认,选预设会自动填好模型地址。图像生成用默认的 RunningHub 云端即可,不需要本地显卡。你只负责「填密钥」和「敲主题」两件事,剩下它自己跑。

从一句话到分镜:AI自动生成短视频脚本

主题交出去之后,大模型产出的不只是一段解说词,它顺手把分镜切好了——每个分镜对应一段画面,后面的配图和配音都由这份脚本驱动。做知识科普类内容,这里藏了个小技巧:把 LLM 的temperature调低一些,输出会更克制、更有条理,适合需要严谨结构的选题。

已经有成稿的话,直接走「固定文案」模式:整段贴进去,分割方式支持按段落、按行、按句子三种,选按句子切,每一句配一张图,画面切换更密集,短视频的节奏感一下就上来了。

💡 固定文案模式下,一句话就是一张图。想让解说不断句,就把句子写短一点。

画面交给模板:从静态配图到动态短片

系统会给每个分镜自动生成一张 AI 插画,风格完全跟着你选的模板走。templates/目录按分辨率分了三档:竖屏 1080x1920、横屏 1920x1080、方形 1080x1080,Web 界面里有模板预览,先看效果再决定,不用凭文件名盲猜。image_book.html的书卷气质压得住知识科普,image_film.html的黑底横版则更像正片。

说白了,模板就是一套 HTML 布局文件,文字位置、背景、排版都由它决定,想调整风格改改样式就行。如果静态图还不够带感,把图像生成切换到 WAN 2.1 这类视频模型,每个分镜的画面就真正动起来,图文视频升级成动态短片。

配音与BGM一次配齐:还能克隆你自己的声音

TTS 环节内置了 Edge-TTS、Index-TTS 等主流方案,下拉选一个,旁白就自动配好了,点「预览语音」还能先试听。想要更有辨识度,上传一段10-30 秒的清晰人声做参考音频,选支持克隆的工作流(如 Index-TTS,Edge-TTS 不支持),系统就能克隆这个音色——做系列内容时,每条视频都带着同一个"个人声音"。

BGM 同样不操心:内置音乐直接选,也可以把自己的音频文件放进bgm/文件夹,界面上就会出现可选项,点「试听 BGM」确认一下再开始生成。

一晚跑完十条:批量模式的点菜清单

批量模式是这台引擎真正的效率放大器。勾选「批量生成模式」,每行写一个主题,最多 100 个,所有视频共用同一套配置,开跑前页面会先给出预估总耗时。照着抄就能跑的一份清单:

  • 模式:AI 生成内容 + 批量模式
  • 主题:10 行,每行一个,比如「居家训练」系列十条
  • LLM:通义千问
  • 图像:RunningHub 云端,按量付费
  • TTS:Edge-TTS
  • 模板:竖屏image_modern.html(1080x1920,适配抖音和视频号)
  • BGM:内置音乐

算笔账:十条视频手动拍摄剪辑,工作量通常是几天起;批量模式下,一个晚上排完队就能收工。成本上,云端图像按张计费,加上每条视频几次 LLM 调用,总花费远低于一天的人工。批量生成期间保持页面打开,跑完的成片会统一进「📚 历史记录」页,方形模板image_minimal_framed.html这类 1080x1080 规格也适合需要多平台铺开的场景。

没有独立显卡?挑一条适合自己的路

两条路径,按机器选。

只有一台普通笔记本:文案走 API,图像走 RunningHub 云端按调用付费,配音用 Edge-TTS——全程不占本地显卡,照样出片。数据默认存在本地output/目录,只有调用云端 API 时才发送必要内容。

手里有 NVIDIA 显卡:LLM 切到本地 Ollama,图像生成指向本地 ComfyUI(默认http://127.0.0.1:8188),语音用 Edge-TTS。整套流程 API 费用为零,数据全部留在本机,连"数据出境"的顾虑都省了。

几个大家都会犹豫的问题

完全没剪辑经验,能上手吗?能。整个流程被抽象成「输主题—选模板—点生成」,全部操作在浏览器里完成,不接触任何剪辑软件和代码。

生成一支视频要等多久?常见耗时几分钟,主要取决于 LLM 响应速度、图像生成的排队情况和网络状况;批量任务会依次排队,开跑前还会显示预估总耗时。

数据会被上传到第三方吗?数据默认保存在本地output/目录,只有调用云端 API 时才会发送必要数据;走本地 Ollama + ComfyUI 路线,可以做到数据完全不出本机。

能商用吗?项目采用 Apache License 2.0 协议,可以自由使用与二次开发,个人创作者和中小团队都能直接搬进自己的内容生产线。

视频制作里最硬的那块环节被拆掉了,剩下选题、表达和对画面的判断,这些是你的主场。你第一个要生成的主题,想好了吗?

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询