Pixelle-Video 测评:AI 自动短视频生成器
Pixelle-Video 是一款由 AI 驱动的自动短视频生成引擎。只需输入一个主题,即可获得包含脚本、AI 图像、配音和背景音乐的完整视频。
- Go
- MIT
- 更新于 2026-05-15

Pixelle-Video 是什么? #
Pixelle-Video 是一款开源、由 AI 驱动的自动短视频生成引擎。只需输入一个主题,它就会自动完成整个视频制作流程:
- ✍️ AI 脚本撰写 —— 根据你的主题生成视频旁白
- 🎨 AI 图像/视频生成 —— 为每个场景生成匹配的画面
- 🗣️ AI 语音合成 —— 使用 TTS 把脚本转换为自然的语音
- 🎵 背景音乐 —— 添加 BGM 以增强氛围
- 🎬 一键视频合成 —— 自动渲染最终视频
零门槛、零剪辑经验 —— 视频创作变得像打一句话一样简单!
🔗 GitHub:https://github.com/AIDC-AI/Pixelle-Video
核心功能 #
| 功能 | 说明 |
|---|---|
| 全自动 | 输入主题 → 得到完整视频 |
| AI 智能脚本 | AI 撰写旁白,无需手动写脚本 |
| AI 图像生成 | 每一句话都配有匹配的 AI 插图 |
| AI 视频生成 | 支持 WAN 2.1 等视频模型,生成动态内容 |
| 多 TTS 支持 | Edge-TTS、Index-TTS 等多种语音合成选项 |
| 背景音乐 | 内置 BGM 支持,营造更好的氛围 |
| 视觉模板 | 多种模板,打造独特的视频风格 |
| 灵活尺寸 | 支持竖版、横版和自定义视频尺寸 |
| 多种 AI 模型 | 支持 GPT、通义千问、DeepSeek、Ollama |
| ComfyUI 架构 | 模块化设计,工作流可自定义 |
视频生成流水线 #
Pixelle-Video 采用模块化设计,流程清晰:
文本输入 → 脚本生成 → 图像规划 → 帧处理 → 视频合成
每个阶段都支持灵活的自定义配置——可以选择不同的 AI 模型、音频引擎、视觉风格,满足个性化的创作需求。
扩展模块 #
除了基础的视频生成,Pixelle-Video 还提供了强大的扩展模块:
👤 数字人头像 #
上传一张照片,生成一段唇形同步的说话人视频。支持包括韩语、中文和英语在内的多种语言。
🖼️ 图生视频 #
使用 AI 视频生成模型,把静态图像转变为动态视频。
💃 动作迁移 #
上传一段参考视频和一张图片来迁移动作——就像让一张照片跟着视频的动作"跳起舞"来。
支持的 AI 模型 #
LLM(脚本生成) #
- OpenAI GPT-4o / GPT-4o-mini
- 阿里通义千问
- DeepSeek V3 / R1
- Ollama(本地部署)
- 自定义 API 端点
图像生成 #
- FLUX(通过 ComfyUI)
- Stable Diffusion
- Qwen 图像生成
- RunningHub 云服务
- Nano Banana 模型
TTS(语音合成) #
- Edge-TTS(免费,多语言)
- Index-TTS(语音克隆)
- ChatTTS
- 自定义 ComfyUI TTS 工作流
快速开始 #
1. 克隆仓库 #
git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video
2. 安装依赖 #
pip install -r requirements.txt
3. 配置 API 密钥 #
编辑 config.json,填入你的 API 密钥:
{
"llm": {
"api_key": "your-api-key",
"base_url": "https://api.openai.com/v1",
"model": "gpt-4o"
},
"image": {
"comfyui_url": "http://127.0.0.1:8188"
}
}
4. 启动 Web UI #
python webui.py
在浏览器中打开 http://localhost:7860。
5. 生成你的第一个视频 #
- 输入一个主题,比如"为什么阅读习惯很重要"
- 选择你喜欢的 TTS 语音
- 选择一个视觉模板
- 点击"生成视频"
- 等待 2-5 分钟,即可获得完整视频
使用场景 #
| 场景 | 示例主题 |
|---|---|
| 知识分享 | “新手应该了解的 10 个 Python 技巧” |
| 产品评测 | “iPhone 16 与 Samsung S24 对比” |
| 故事叙述 | “一位创业者的历程” |
| 教育内容 | “区块链是如何工作的?” |
| 新闻评论 | “2026 年的 AI 趋势” |
| 书籍/电影评论 | “《原子习惯》带来的启示” |
视频风格示例 #
Pixelle-Video 支持多种视频风格:
- 🌄 纪录片风格 —— 旅行、自然、人物故事
- 🔍 文化分析 —— 深入剖析趋势与现象
- 🔭 科学与哲学 —— 把复杂概念讲简单
- 🌱 个人成长 —— 自我提升、效率提升
- 🧠 深度思考 —— 心理学、哲学、反思
- 🏯 历史与文化 —— 古代智慧、历史事件
- ☀️ 情感向 —— 暖心故事、励志内容
- 📜 小说解读 —— 小说评论、人物分析
- 🧬 健康养生 —— 医疗小贴士、养生建议
技术架构 #
Pixelle-Video 构建在 ComfyUI 架构之上:
- 模块化工作流 —— 每个组件(LLM、TTS、图像生成)都是独立的节点
- 可定制的流水线 —— 可以轻松替换任意模型或服务
- API 优先设计 —— 所有能力都通过 REST API 暴露
- Web UI —— 基于 Gradio 的界面,易于使用
- 批处理 —— 可以同时生成多个视频
性能与成本 #
| 方案 | 成本 | 速度 | 质量 |
|---|---|---|---|
| 本地部署 | 免费(需要 GPU) | 快 | 高 |
| RunningHub 云服务 | 按量付费 | 即时 | 高 |
| 混合模式 | 灵活 | 均衡 | 高 |
新手推荐配置:
- LLM:DeepSeek API(便宜,质量好)
- 图像:RunningHub(无需本地 GPU)
- TTS:Edge-TTS(免费,多语言)
与其他工具的比较 #
| 特性 | Pixelle-Video | HeyGen | Synthesia | Pictory |
|---|---|---|---|---|
| 开源 | ✅ | ❌ | ❌ | ❌ |
| 免费套餐 | ✅ | 有限 | 有限 | 有限 |
| 本地部署 | ✅ | ❌ | ❌ | ❌ |
| 自定义模型 | ✅ | ❌ | ❌ | ❌ |
| ComfyUI 集成 | ✅ | ❌ | ❌ | ❌ |
| 语音克隆 | ✅ | ✅ | ✅ | ❌ |
| 数字人 | ✅ | ✅ | ✅ | ❌ |
| 动作迁移 | ✅ | ❌ | ❌ | ❌ |
获得最佳效果的技巧 #
- 主题要具体 —— 越具体的主题往往能生成更好的脚本
- 模板选择 —— 让模板与内容风格相匹配
- 提示词前缀 —— 使用英文提示词前缀以获得更一致的图像风格
- 语音预览 —— 在生成完整视频前务必先预览 TTS 效果
- 批量生成 —— 生成 3-5 个版本,挑选最好的一个
相关文章 #
- Free Claude Code:在任何 AI 提供商上免费使用 Claude Code CLI —— 免费的 AI 编程助手
- Agent Reach:给你的 AI Agent 装上互联网超能力 —— 拥有互联网访问能力的 AI Agent
结语 #
Pixelle-Video 把 LLM、图像生成、TTS 和视频剪辑整合进一条自动化流水线,让视频创作变得人人可用。无论你是内容创作者、教育工作者、市场营销人员还是开发者,这款工具都能帮你节省大量视频制作时间。
基于 ComfyUI 的架构意味着它不仅仅是一个黑盒工具——你可以自定义每一个组件、替换模型,搭建属于自己的视频生成工作流。
最适合:需要快速产出视频的内容创作者、教育工作者、营销人员和开发者
GitHub:https://github.com/AIDC-AI/Pixelle-Video
推荐工具 #
对于正在构建或部署开源 AI 工具的开发者,我们推荐:
- DigitalOcean —— 新用户 $200 免费额度,覆盖全球 14+ 个地区,一键式 GPU/CPU Droplet,非常适合 AI 工作负载。
- Shiyunapi Claude API —— Anthropic Claude / OpenAI / DeepSeek API 代理。上面提到的大多数 AI 工具(聊天机器人、代码生成、翻译、搜索等)都需要一个 LLM API 密钥——这个代理以约官方价格 30% 的成本提供顶级模型的稳定访问。
联盟链接 —— 支持 dibi8.com,你无需为此付出任何代价。
最后更新:2026-05-06
💬 留言讨论