Pixelle-Video 上手指南:一个主题到 AI 短视频成片的完整路径

📅 发布时间:2026/10/2 21:34:25
Pixelle-Video 上手指南:一个主题到 AI 短视频成片的完整路径
Pixelle-Video 上手指南一个主题到 AI 短视频成片的完整路径【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-VideoPixelle-Video 是一个开源的 AI 短视频生成引擎核心问题只有一个你手里只有一个选题却交不出成片。写文案、找素材、配音、剪辑这些事它全接过去你只负责输入主题。读完这篇你会在本机起一个 Web 服务配好 API Key10 分钟内拿到第一条自动生成的短视频。先判断Pixelle-Video 适合谁先说结论它适合想批量做口播、科普、书单这类图文配音短视频、又不想碰剪辑软件的人。适合的场景账号日更内容以知识讲解、观点输出为主画面要求不高已有现成稿件想把文字快速变成带配音的成品有 NVIDIA 显卡想本地白嫖或者什么都没有想直接走云端不适合的场景需要真人出镜、复杂转场、逐帧调动的影视级内容——它的画面是模板AI 图/视频上限就在那里完全没有 LLM API Key、也没有本地显卡的人——文案和配图至少得有一头是付费或本地的全免费需要 Ollama 本地模型 本地 ComfyUI 两套环境折腾程度不低一句话边界它解决的是量产及格线以上的解说视频不是做出有设计感的片子。零基础跑起来装环境、配 Key、出第一条片整条最短路径就是三步装依赖、起服务、在界面里配一次 Key。第 1 步装好两个前置依赖。# macOS brew install ffmpeg # Ubuntu / Debian sudo apt install ffmpeg再装一个 Python 包管理器 uv一行命令按系统提示走即可装完用ffmpeg -version和uv --version各敲一次有版本号输出就都好了。ffmpeg 负责最终的视频合成缺了它界面都打不开。第 2 步克隆仓库并启动 Web 服务。git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv run streamlit run web/app.pyuv run会自动建虚拟环境、装完全部依赖不用手动pip install。Windows 用户更省事直接下载官方的 Windows 整合包解压后双击start.bat依赖全省了。服务起来后浏览器会自动打开http://localhost:8501看到三栏界面左侧内容输入、中间语音视觉、右侧生成预览就算跑通了。第 3 步配一次 Key生成第一条片。展开左侧「⚙️ 系统配置」面板在 LLM 配置里从下拉菜单选一个预设比如通义千问便宜且够用把 API Key 粘进去点「保存配置」。左侧「内容输入」选「AI 生成内容」输入一个具体主题比如「为什么要养成阅读习惯」——越具体的主题LLM 写出来的分镜越聚焦比「宇宙」「成长」这类大词效果好。中间栏全部保持默认TTS 用 Edge-TTS图像走默认工作流模板任选一个竖屏 1080x1920 的。右侧点「生成视频」。进度按「文案 → 逐分镜配图 → 合成语音 → 合成视频」推进5 个分镜大约 2–5 分钟出片。完成后右侧自动播放显示时长、文件大小、分镜数文件落在根目录output/文件夹「 历史」页面里还能翻出来重看。一条成片由哪几块拼成别把它当成一个黑盒拆开看就四块每块都有明确的开关改哪个配置出什么效果心里要有数。文案LLM 按主题写稿并拆成分镜默认 5 个。想换模型改配置文件的llm字段config.example.yaml 里有注释示例——它兼容一切 OpenAI SDK 格式接口通义千问、GPT、DeepSeek、本地 Ollama 都能接。手里已有稿件时切到「固定文案内容」模式还能指定按段落、行或句子拆分。画面每个分镜配一张 AI 图或一段 AI 视频。三条路线本地 ComfyUIworkflows/selfhost/、云端 RunningHubworkflows/runninghub/、直连供应商 APIDashScope、OpenAI、Kling 等在api_providers配置。默认尺寸 1024x1024整体画风由提示词前缀统一控制。声音解说走 TTS 工作流默认selfhost/tts_edge.jsonEdge-TTS也可选 Index-TTS 并上传参考音频克隆音色。BGM 分内置和自定义两类——自定义的 MP3/WAV 必须手动放进根目录bgm/文件夹才会出现在列表里。合成模板负责最终排版。模板文件都是 HTML CSS放在 templates/ 目录按竖屏 1080x1920、横屏 1920x1080、方形 1080x1080 三个尺寸分组文件前缀即类型static_*纯文字image_*用 AI 图做背景video_*用 AI 视频做背景。文字、图片通过 Jinja2 变量{{ title }}、{{ text }}、{{ image }}注入。整体链路可以参考这张官方流程图把成片调成你的风格选路线、改模板、换音色AI 配图路线怎么选出片速度和成本的最大变量就是图从哪来。在中间栏「图像生成」下拉框里选工作流有 NVIDIA 显卡、本地起了 ComfyUI → 选selfhost工作流最快且免费没有显卡 → 选 RunningHub 工作流到系统配置面板填 RunningHub API Key只有云 API Key → 选api/...工作流再到api_providers填对应供应商密钥自建视频模板模板就是 HTML CSS想有自己的版式复制 templates/1920x1080/ 里任意一个现有模板改掉样式后以.html存进对应尺寸目录它会自动出现在模板下拉列表里不用改任何代码。注意body尺寸必须和所在目录一致竖屏目录就写 1080px × 1920px否则文字排版会溢出画面。克隆音色想换成自己的声音TTS 选 Index-TTS 这类支持克隆的工作流上传一段清晰的人声 MP3 作为参考音频生成的旁白就是那个音色。正式生成前先点「预览语音」试听这是验证音色成本最低的环节。翻车急救箱症状界面打不开或启动报错。原因ffmpeg 没装或 Python 版本低于 3.10。解法先装 ffmpeg用ffmpeg -version验证有输出依赖装不上时执行uv cache clean清缓存再重新uv sync一次。症状生成卡在「生成配图」一步不动。原因选了 selfhost 工作流但本地 ComfyUI 没启动或对应模型文件没下载。解法确认浏览器能直接访问http://127.0.0.1:8188再到配置面板点「测试连接」通过后再生成。症状文案生成不出来提示 LLM 调用失败。原因API Key 有误、账户余额不足、网络不通。解法核对配置面板里的 Key 是否完整粘贴用本地 Ollama 的话确认服务已启动且模型已拉取。症状配图风格和模板画风不搭。原因提示词前缀写了中文或图像尺寸超出模型支持范围。解法提示词前缀用英文风格词例如 minimal sketch style宽高在模型允许的范围内调整。症状生成特别慢。原因分镜数多或高峰期挤在云端 API。解法把分镜数从 5 调小有本地 GPU 时切到 selfhost 工作流比云端明显快。下一步Pixelle-Video 把一个主题到一条成片压缩成了点一次按钮写稿、配图、配音、混 BGM、合成全部自动完成你的精力只需要花在选题和风格上。想继续往下玩——自定义视觉风格、声音克隆、模板开发、API 对接——仓库里的 docs/zh/ 中文文档有分场景的教程照着第一条视频的生成记录一个个试即可。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考