Pixelle-Video 测评:AI 自动短视频生成器

Pixelle-Video 是一款由 AI 驱动的自动短视频生成引擎。只需输入一个主题,即可获得包含脚本、AI 图像、配音和背景音乐的完整视频。

  • Go
  • MIT
  • 更新于 2026-05-15

Pixelle-Video web UI showing script, TTS, scene template, generated output
来源:github.com/AIDC-AI/Pixelle-Video —— 官方 Web UI

Pixelle-Video 是什么? #

Pixelle-Video 是一款开源、由 AI 驱动的自动短视频生成引擎。只需输入一个主题,它就会自动完成整个视频制作流程:

  • ✍️ AI 脚本撰写 —— 根据你的主题生成视频旁白
  • 🎨 AI 图像/视频生成 —— 为每个场景生成匹配的画面
  • 🗣️ AI 语音合成 —— 使用 TTS 把脚本转换为自然的语音
  • 🎵 背景音乐 —— 添加 BGM 以增强氛围
  • 🎬 一键视频合成 —— 自动渲染最终视频

零门槛、零剪辑经验 —— 视频创作变得像打一句话一样简单!

🔗 GitHubhttps://github.com/AIDC-AI/Pixelle-Video


核心功能 #

功能说明
全自动输入主题 → 得到完整视频
AI 智能脚本AI 撰写旁白,无需手动写脚本
AI 图像生成每一句话都配有匹配的 AI 插图
AI 视频生成支持 WAN 2.1 等视频模型,生成动态内容
多 TTS 支持Edge-TTS、Index-TTS 等多种语音合成选项
背景音乐内置 BGM 支持,营造更好的氛围
视觉模板多种模板,打造独特的视频风格
灵活尺寸支持竖版、横版和自定义视频尺寸
多种 AI 模型支持 GPT、通义千问、DeepSeek、Ollama
ComfyUI 架构模块化设计,工作流可自定义

视频生成流水线 #

Pixelle-Video 采用模块化设计,流程清晰:

文本输入 → 脚本生成 → 图像规划 → 帧处理 → 视频合成

每个阶段都支持灵活的自定义配置——可以选择不同的 AI 模型、音频引擎、视觉风格,满足个性化的创作需求。


扩展模块 #

除了基础的视频生成,Pixelle-Video 还提供了强大的扩展模块:

👤 数字人头像 #

上传一张照片,生成一段唇形同步的说话人视频。支持包括韩语、中文和英语在内的多种语言。

🖼️ 图生视频 #

使用 AI 视频生成模型,把静态图像转变为动态视频。

💃 动作迁移 #

上传一段参考视频和一张图片来迁移动作——就像让一张照片跟着视频的动作"跳起舞"来。


支持的 AI 模型 #

LLM(脚本生成) #

  • OpenAI GPT-4o / GPT-4o-mini
  • 阿里通义千问
  • DeepSeek V3 / R1
  • Ollama(本地部署)
  • 自定义 API 端点

图像生成 #

  • FLUX(通过 ComfyUI)
  • Stable Diffusion
  • Qwen 图像生成
  • RunningHub 云服务
  • Nano Banana 模型

TTS(语音合成) #

  • Edge-TTS(免费,多语言)
  • Index-TTS(语音克隆)
  • ChatTTS
  • 自定义 ComfyUI TTS 工作流

快速开始 #

1. 克隆仓库 #

git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video

2. 安装依赖 #

pip install -r requirements.txt

3. 配置 API 密钥 #

编辑 config.json,填入你的 API 密钥:

{
  "llm": {
    "api_key": "your-api-key",
    "base_url": "https://api.openai.com/v1",
    "model": "gpt-4o"
  },
  "image": {
    "comfyui_url": "http://127.0.0.1:8188"
  }
}

4. 启动 Web UI #

python webui.py

在浏览器中打开 http://localhost:7860

5. 生成你的第一个视频 #

  1. 输入一个主题,比如"为什么阅读习惯很重要"
  2. 选择你喜欢的 TTS 语音
  3. 选择一个视觉模板
  4. 点击"生成视频"
  5. 等待 2-5 分钟,即可获得完整视频

使用场景 #

场景示例主题
知识分享“新手应该了解的 10 个 Python 技巧”
产品评测“iPhone 16 与 Samsung S24 对比”
故事叙述“一位创业者的历程”
教育内容“区块链是如何工作的?”
新闻评论“2026 年的 AI 趋势”
书籍/电影评论“《原子习惯》带来的启示”

视频风格示例 #

Pixelle-Video 支持多种视频风格:

  • 🌄 纪录片风格 —— 旅行、自然、人物故事
  • 🔍 文化分析 —— 深入剖析趋势与现象
  • 🔭 科学与哲学 —— 把复杂概念讲简单
  • 🌱 个人成长 —— 自我提升、效率提升
  • 🧠 深度思考 —— 心理学、哲学、反思
  • 🏯 历史与文化 —— 古代智慧、历史事件
  • ☀️ 情感向 —— 暖心故事、励志内容
  • 📜 小说解读 —— 小说评论、人物分析
  • 🧬 健康养生 —— 医疗小贴士、养生建议

技术架构 #

Pixelle-Video 构建在 ComfyUI 架构之上:

  • 模块化工作流 —— 每个组件(LLM、TTS、图像生成)都是独立的节点
  • 可定制的流水线 —— 可以轻松替换任意模型或服务
  • API 优先设计 —— 所有能力都通过 REST API 暴露
  • Web UI —— 基于 Gradio 的界面,易于使用
  • 批处理 —— 可以同时生成多个视频

性能与成本 #

方案成本速度质量
本地部署免费(需要 GPU)
RunningHub 云服务按量付费即时
混合模式灵活均衡

新手推荐配置:

  • LLM:DeepSeek API(便宜,质量好)
  • 图像:RunningHub(无需本地 GPU)
  • TTS:Edge-TTS(免费,多语言)

与其他工具的比较 #

特性Pixelle-VideoHeyGenSynthesiaPictory
开源
免费套餐有限有限有限
本地部署
自定义模型
ComfyUI 集成
语音克隆
数字人
动作迁移

获得最佳效果的技巧 #

  1. 主题要具体 —— 越具体的主题往往能生成更好的脚本
  2. 模板选择 —— 让模板与内容风格相匹配
  3. 提示词前缀 —— 使用英文提示词前缀以获得更一致的图像风格
  4. 语音预览 —— 在生成完整视频前务必先预览 TTS 效果
  5. 批量生成 —— 生成 3-5 个版本,挑选最好的一个

相关文章 #


结语 #

Pixelle-Video 把 LLM、图像生成、TTS 和视频剪辑整合进一条自动化流水线,让视频创作变得人人可用。无论你是内容创作者、教育工作者、市场营销人员还是开发者,这款工具都能帮你节省大量视频制作时间。

基于 ComfyUI 的架构意味着它不仅仅是一个黑盒工具——你可以自定义每一个组件、替换模型,搭建属于自己的视频生成工作流。

最适合:需要快速产出视频的内容创作者、教育工作者、营销人员和开发者

GitHubhttps://github.com/AIDC-AI/Pixelle-Video


推荐工具 #

对于正在构建或部署开源 AI 工具的开发者,我们推荐:

  • DigitalOcean —— 新用户 $200 免费额度,覆盖全球 14+ 个地区,一键式 GPU/CPU Droplet,非常适合 AI 工作负载。
  • Shiyunapi Claude API —— Anthropic Claude / OpenAI / DeepSeek API 代理。上面提到的大多数 AI 工具(聊天机器人、代码生成、翻译、搜索等)都需要一个 LLM API 密钥——这个代理以约官方价格 30% 的成本提供顶级模型的稳定访问。

联盟链接 —— 支持 dibi8.com,你无需为此付出任何代价。

最后更新:2026-05-06

参考与来源 #

💬 留言讨论