Pixelle-Video AI短视频生成实操:从安装到出第一个成片

Pixelle-Video AI短视频生成实操:从安装到出第一个成片

【免费下载链接】Pixelle-Video 🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine 【免费下载链接】Pixelle-Video 项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

Pixelle-Video 是一个开源的 AI 全自动短视频引擎:输入一个主题(或直接粘贴一段完整文案),它会自动完成脚本撰写、逐分镜配图、语音合成和视频合成,最后输出可直接发布的视频文件。它面向需要高频更新短视频的自媒体创作者、知识科普账号,以及想尝试 AI 视频生成但没空研究 ComfyUI 工作流的人。整个过程在浏览器里完成,你要做的只有管理几组 API 密钥。

安装 Pixelle-Video:Windows 整合包与源码启动

Windows 用户走最短路径:下载官方发布的整合包,解压后双击 start.bat,浏览器会直接打开 http://localhost:8501。整合包自带全部依赖,不需要单独装 Python、uv 或 ffmpeg。

macOS 和 Linux 用户从源码启动。前置条件是两样:Python 包管理器 uv,以及视频处理工具 ffmpeg(用 brew 或 apt 安装)。之后克隆仓库:

git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video
cd Pixelle-Video
uv run streamlit run web/app.py

uv 首次运行会自动安装依赖,启动后浏览器自动打开 8501 端口的 Web 界面。

配置三组密钥:LLM、图像生成、TTS

首次启动展开「系统配置」面板,配置分三块:

  • LLM:负责写脚本,任何 OpenAI 兼容接口都能接。界面提供通义千问、GPT-4o、DeepSeek、Ollama 等预设,选中后 base_url 和模型名自动填充,只需填 API Key。Ollama 指向本地模型,不花钱,但要求机器能跑起来。
  • 图像生成:三条路线。本地 ComfyUI(填地址,默认 127.0.0.1:8188,可点「测试连接」);RunningHub 云端(填 API Key,无需本地环境);直连模型 API(OpenAI、DashScope、Seedream/Seedance、Kling 等,按供应商填密钥,完全绕开 ComfyUI)。
  • TTS 工作流:下拉选择文本转语音方案。默认 Edge-TTS 稳定省心;Index-TTS 支持声音克隆,上传一段参考音频(MP3/WAV 等)即可试听克隆效果。

习惯用文件管理配置的人,可以直接照着 config.example.yaml 修改,字段和 Web 界面一一对应。

跑通第一个视频:从主题到成片的完整流程

  1. 输入内容:左栏选「AI 生成内容」,输入主题,比如“为什么要养成阅读习惯”。已有文案就选「固定文案」直接粘贴(支持按段落、行、句子分割),跳过 LLM 写稿环节。
  2. 配背景音乐:三选一,无 BGM、内置音乐,或把自己的 MP3/WAV 放进 bgm/ 目录,都可试听。
  3. 调整视觉:中栏选图像工作流和视频模板,图像尺寸默认 1024x1024。提示词前缀(需英文)控制插画整体风格,点「预览风格」先出单张测试。
  4. 生成:右栏点生成按钮,进度实时显示,例如“分镜 3/5 - 生成插图”。5 个分镜通常耗时 2-5 分钟,瓶颈取决于最慢的图像生成或 TTS 环节。
  5. 收片:完成后视频自动播放,显示时长、大小、分镜数,文件落在 output/ 目录。

Pixelle-Video AI短视频生成方形模板成片效果

这是方形(1080x1080)模板的产出:AI 插画居中,标题与解说文字按版式叠加。

两个容易踩的坑:不同生图模型对尺寸限制不同,想要的分辨率不被支持时以模型官方说明为准;提示词前缀必须写英文,中文对出图风格基本无效。

视频模板怎么选:static_、image_、video_ 三类命名

模板决定画面版式,存放在 templates/,按尺寸分组显示:竖屏 1080x1920(短视频平台用)、横屏 1920x1080、方形 1080x1080。文件名前缀直接标明它消耗哪类媒体资源:

  • static_*.html:不生成任何 AI 媒体,纯文字画面。出片最快,生成成本几乎为零;
  • image_*.html:以 AI 图片为背景。最常用的类型,成本和效果均衡;
  • video_*.html:以 AI 生成的视频片段为背景,基于 WAN 2.1 等模型。每个分镜多一次视频模型调用,耗时和费用都明显上升。

模板本身是 HTML 加 CSS 写的,懂前端就可以自创后放进 templates/ 目录被自动识别。「预览模板」功能允许先调参数看版式,不用跑完整流程。

Pixelle-Video AI短视频生成横屏深色科技模板效果

这张横屏模板对应 image_wide_darktech:左侧标题区、右侧 AI 插画,是横屏解说类视频常见的布局。

实际建议:先用 image_ 模板跑通内容,确认动态背景确有必要时再切 video_ 模板,省下的都是视频模型的调用费用。

替换各环节能力:工作流目录与直连模型

workflows/ 目录会被自动扫描,按部署方式分两个子目录:selfhost/(本地 ComfyUI 执行)和 runninghub/(RunningHub 云端调用)。同一能力通常有对应版本,例如图像生成有 image_fluximage_qwenimage_sd3.5,视频生成有 video_wan2.1_fusionx,TTS 有 tts_edge 和支持声音克隆的 tts_index2。在 ComfyUI 里设计好工作流、导出 JSON、丢进目录,界面里就能选到——接新模型(比如更新的 FLUX 版本或 ChatTTS)走的就是这条路。

不想碰 ComfyUI 也有前缀为 api/... 的直连工作流:系统配置里填好对应供应商密钥,直接调用模型服务。数字人口播、图生视频两个扩展流水线,以及上传参考视频和图片的动作迁移模块,也都基于这套能力组合,按需开关。

另一个入口是「自定义素材」:上传自己的照片或视频,系统先用 VLM 分析素材内容,再围绕分析结果生成脚本,适合先拍素材再后期包装的工作方式。

成本与耗时:先定组合再谈效果

开销主要在 LLM API 和媒体生成(图像、视频、TTS)两部分,常见三档组合各有取舍:

  • 零成本:Ollama 本地 LLM 加本地 ComfyUI。代价是需要一张跑得动生图模型的独显,加上部署时间;
  • 低成本:通义千问 API 加本地 ComfyUI。LLM 侧花费很低,图像靠自己的机器出;
  • 云端:GPT 或千问加 RunningHub、Kling、Seedance 等直连。不用管硬件,按次计费,适合不想维护 GPU 的用户。

耗时上,5 分镜视频一般 2-5 分钟;减少分镜数、改用本地服务会更快。效果不满意时,调整顺序建议是:换 LLM 模型改文案风格,换提示词前缀和尺寸改配图,换 TTS 或上传参考音频改声音,最后换模板改版式。TTS 失败时先回退 Edge-TTS 试一轮,能借此判断问题出在工作流还是服务连接。

【免费下载链接】Pixelle-Video 🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine 【免费下载链接】Pixelle-Video 项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值