阿里达摩院孵化的 AIDC-AI 团队开源了 Pixelle-Video——你只要输入一个主题,AI 自动完成"写文案→配图/视频→配音→配 BGM→合成"整条流水线,几分钟产出一条完整短视频。半年 21,751 星,Apache 2.0 可商用。
最近看到一个让人坐不住的项目:Pixelle-Video。
它的玩法很简单——你只要给它一个主题(比如"为什么要养成阅读习惯"),点一下按钮,几分钟之后它就给你吐出一条完整的短视频。文案、配图、配音、BGM、字幕、动效全搞定,你连剪辑软件都不用开。
官方原话:"零门槛,零剪辑经验,让视频创作成为一句话的事。"
听起来像噱头?我去翻了它 GitHub 上 21,751 颗星背后的真实数据,把它和同类项目做了个交叉对比,给你完整拆解这套"AI 短视频印钞机"到底能不能用、值不值得用。

一、项目概况:阿里达摩院出的,半年破 2 万星
| 项目属性 | 详情 |
|---|---|
| 仓库地址 | github.com/AIDC-AI/Pixelle-Video |
| 所属组织 | AIDC-AI(阿里达摩院孵化的 AI 团队) |
| Slogan | AI 全自动短视频引擎 |
| 开源协议 | Apache License 2.0(可商用、需保留版权) |
| 项目语言 | Python(≥ 3.11) |
| 首次提交 | 2025-11-07 |
| 最新版本 | v0.1.15(2026-01-27) |
| Stars / Forks | 21,751 / 3,060(增长速度极快,半年破 2 万星) |
| 主要标签 | aigc、comfyui、image-generation、tts、video-generation |
| 官方文档 | aidc-ai.github.io/Pixelle-Video/zh |
| 视频教程 | B 站 BV1WzyGBnEVp |
一句话定义:你只需要给它一个主题关键词,它就能自动完成"写文案 → 配图/视频 → 配音 → 配 BGM → 合成视频"整条流水线,把一段短视频像印钞一样批量产出来。
二、它到底能干什么?
2.1 核心能力:输入一句话,输出一条视频
按官方 README 的标准流程,整个自动化流水线是这样跑的:
输入主题(比如"为什么要养成阅读习惯")
↓
AI 自动撰写视频文案(多段解说词)
↓
为每句文案匹配 AI 配图(或 AI 视频片段)
↓
用 TTS 把文案合成语音解说
↓
添加背景音乐
↓
套上视频模板(字幕、动效、画面布局)
↓
一键合成最终短视频
整个过程你只需要在 Web 界面里输入主题、点一下按钮。
2.2 能力清单(来自官方 README 的"功能亮点")
- ✅ 全自动生成:输入主题,几分钟出一条完整视频
- ✅ AI 智能文案:自动写脚本
- ✅ AI 生成配图:支持 FLUX、Qwen、SD3.5、SDXL、Z-Image、Nano Banana 等多种图像模型
- ✅ AI 生成视频:支持 WAN 2.1、WAN 2.2、LTX2、Seedance、HappyHorse 等视频模型
- ✅ 直连模型 API:不用本地跑 ComfyUI,直接调用 DashScope、OpenAI、ARK、Kling 等
- ✅ AI 生成语音:支持 Edge-TTS、Index-TTS(支持声音克隆)、Spark-TTS
- ✅ 背景音乐:内置 BGM 库,支持自定义
- ✅ 视觉风格:20+ 预设模板(抖音风、电影风、治愈系、卡通、复古等)
- ✅ 灵活尺寸:竖屏 1080×1920(抖音/小红书)、横屏 1920×1080(B 站/YouTube)、方形 1080×1080(朋友圈)
- ✅ 多 LLM 切换:Qwen、GPT-4o、Claude Sonnet 4.5、DeepSeek、Ollama、Moonshot
- ✅ 原子能力灵活组合:图像、视频、TTS、VLM 都可以单独替换
2.3 进阶模块(2026 年 Q1 上线)
- 👤 数字人口播:让 AI 数字人讲解内容(已支持韩语等多语言)
- 🖼️ 图生视频:上传一张图片,让它动起来
- 💃 动作迁移:上传参考视频和图片,让图片里的人物"复制"参考视频的动作(跳舞的小猫就是典型案例)
- 🎨 自定义素材:上传自己的照片/视频,AI 智能分析生成脚本
2.4 它解决了什么商业问题?
| 痛点 | Pixelle-Video 的解法 |
|---|---|
| 短视频日更压力大 | 输入主题就出片,产能放大 10 倍 |
| 不会写脚本 | 6 个主流 LLM 随选,AI 自动写 |
| 不会用 PR/AE | Web 界面点点点就行 |
| 配音贵/不自然 | 内置 Edge-TTS 免费 + Index-TTS 可声音克隆 |
| 模板风格单一 | 20+ 模板,覆盖各垂类 |
| 担心被云服务绑定 | 全栈开源、Apache 2.0、可商用、可私有部署 |
一句话总结:它把"短视频生产"从"手艺活"变成了"流水线",是 AIGC 时代的内容生产工具。
三、适合谁用?6 类典型用户
官方没有明确列"目标用户",但从功能矩阵、模板分类、文档教程反推,最适合以下 6 类人:
3.1 自媒体短视频创作者
知识科普、情感语录、励志鸡汤、书单号、历史解说等"口播+配图"型账号。官方 README 展示的 9 个案例视频中 6 个是这种类型。
3.2 MCN 机构 / 内容工作室
需要日更多条视频、把单条视频成本从几十块压到几分钱。同一主题可以批量生成多个变体。
3.3 电商运营
商品讲解视频自动生成("养生知识"、"健康饮食"模板已展示)。跨境电商的多语言视频(数字人口播支持多语言)。
3.4 教育/培训行业
课程视频、知识点科普("科学思辨"、"个人成长"模板)。企业内训视频批量制作。
3.5 个人开发者 / AI 工具爱好者
二次开发:在 Pixelle-Video 基础上做定制。研究:背后是 SIGGRAPH Asia 学术项目(FilmAgent、Anim-Director、AniMaker)。
3.6 不想被国外 SaaS 绑架、又想要 AIGC 能力的团队
全栈开源 + Apache 2.0 = 可商用、可私有化、可二开。
3.7 不适合谁?
- 需要电影级专业剪辑的(Pr/AE 仍是首选)
- 需要实时直播数字人(它是离线生成,不是实时驱动)
- 完全没有显卡也不愿付费云端 API 的(虽然有完全免费方案,但 Ollama 本地推理需要算力)
四、和相似项目怎么比?
官方 README 明确列出了 5 个参考/启发项目,我把它们和 Pixelle-Video 做一张对比表(信息全部来自各项目官方仓库和 Pixelle-Video 官方说明):
| 项目 | 主要定位 | 与 Pixelle-Video 的差异 |
|---|---|---|
| Pixelle-MCP(AIDC-AI 自家) | ComfyUI 的 MCP 服务器,让 AI 助手直接调用 ComfyUI | 基础设施层;Pixelle-Video 是它的"上层应用" |
| MoneyPrinterTurbo(harry0703) | 较早一批的 AI 视频生成工具 | 功能较单一,扩展性弱;Pixelle-Video 基于 ComfyUI 架构,可替换任何环节 |
| NarratoAI(linyqh) | 影视解说自动化工具 | 专注解说垂类;Pixelle-Video 是通用平台,覆盖更广 |
| MoneyPrinterPlus(ddean2009) | 视频创作平台 | 综合工具;Pixelle-Video 把所有"原子能力"(LLM/图像/视频/TTS)模块化 |
| ComfyKit(puke3615) | ComfyUI 工作流封装库 | 底层依赖库;Pixelle-Video 直接使用 ComfyKit 作为 ComfyUI 调度器 |
官方原文:"Pixelle-Video 的设计受到以下优秀开源项目的启发",并致谢这些项目。
4.1 Pixelle-Video 的差异化优势
- 架构更现代:基于 ComfyUI 的"工作流"机制,可以精确控制每一步的模型/参数,不像早期项目是"黑盒串联"
- 原子化设计:LLM / TTS / 图像 / 视频 / VLM 五大能力完全可替换,技术债最低
- 三种部署路径:本地 ComfyUI / 云端 RunningHub / 直连 API(OpenAI/DashScope/Kling/ARK),灵活度最高
- 学术背书:背后是 AIDC-AI 团队 SIGGRAPH Asia 2024/2025 的系列论文(FilmAgent、Anim-Director、AniMaker),不是临时攒的项目
- 可商用:Apache 2.0,不像部分项目是 AGPL/MIT 限制
五、怎么部署?三种方式 + 资源清单
5.1 方式 A:Windows 一键整合包(最省事)
适合:Windows 用户、想 5 分钟跑起来
- 到 releases/latest 下载最新整合包(v0.1.15 的 zip 是 380 MB)
- 解压到任意目录
- 双击
start.bat - 浏览器自动打开 http://localhost:8501
- 在"⚙️ 系统配置"里填 API Key,开始生成
零依赖:Python、uv、ffmpeg 都打包在内。
5.2 方式 B:源码安装(macOS / Linux)
适合:开发者、想自定义
前置环境:
- Python ≥ 3.11(pyproject.toml 中
requires-python = ">=3.11",注意 installation.md 写的是 3.10+) - ffmpeg(macOS 用
brew install ffmpeg,Ubuntu 用sudo apt install ffmpeg) - uv(包管理器):
curl -LsSf https://astral.sh/uv/install.sh | sh
步骤:
git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video
uv sync # 自动装依赖
uv run streamlit run web/app.py # 启动 Web(端口 8501)
5.3 方式 C:Docker 部署(生产环境推荐)
适合:服务器部署、长期运行
前置:Docker + Docker Compose
git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video
# 国内环境用清华镜像加速构建
USE_CN_MIRROR=true docker-compose up -d
启动后有两个服务:
- API 服务:FastAPI,端口 8000(
/health端点做健康检查) - Web UI:Streamlit,端口 8501
docker-compose.yml 已经做好:
- 配置自动初始化(
init服务从config.example.yaml复制出config.yaml) - 数据持久化(
./data、./output挂载到容器) - 健康检查 + 自动重启
- 时区设置
Asia/Shanghai
5.4 系统资源要求
| 资源 | 最低 | 推荐 |
|---|---|---|
| 操作系统 | Windows 10 / macOS 11 / Ubuntu 20.04 | 较新系统 |
| Python | 3.11 | 3.11+ |
| 内存 | 4 GB | 8 GB+ |
| 硬盘 | 5 GB(不含模型) | 20 GB+(含 ComfyUI 模型) |
| GPU | 可选 | NVIDIA 6GB+ 显存(仅本地 ComfyUI 需要) |
| 网络 | 稳定 | 稳定(云端 API 需要) |
六、怎么配置?
配置文件路径:config.yaml(从 config.example.yaml 复制)。下面是配置结构的中文解读,全部内容来自官方配置示例:
6.1 LLM 配置(必填)
写视频文案用的大模型。支持任何兼容 OpenAI SDK 协议的 API。
官方预设了 6 个(来自 pixelle_video/llm_presets.py):
| 名称 | base_url | model | 备注 |
|---|---|---|---|
| Qwen(推荐) | https://dashscope.aliyuncs.com/compatible-mode/v1 | qwen-max | 国内性价比高 |
| OpenAI | https://api.openai.com/v1 | gpt-4o | 需科学上网 |
| Claude | https://api.anthropic.com/v1/ | claude-sonnet-4-5 | 需科学上网 |
| DeepSeek | https://api.deepseek.com | deepseek-chat | 国内便宜 |
| Ollama | http://localhost:11434/v1 | llama3.2 | 本地免费 |
| Moonshot(月之暗面) | https://api.moonshot.cn/v1 | moonshot-v1-8k | 长文本 |
Web 界面的下拉菜单可以直接选预设,会自动填 base_url 和 model,你只需要填 api_key。
6.2 媒体生成配置(二选一)
两条路径:
路径 A:ComfyUI(工作流派)
- 适合:想精细控制、可本地部署
- 需要:本地起 ComfyUI 服务(默认端口 8188),或注册 RunningHub 云端账号
- RunningHub 还支持 24GB / 48GB 显存机器切换、并发限制(1-10)
路径 B:直连 API(最省事)
官方配置示例里直接列了 4 家供应商:
| 供应商 | 用途 | 默认 base_url |
|---|---|---|
| OpenAI | GPT Image 系列 | https://api.openai.com/v1 |
| DashScope | 通义万象 Wan 视频、HappyHorse 视频、Qwen 图像 | https://dashscope.aliyuncs.com/api/v1 |
| Volcengine ARK | 字节 Seedream 图像、Seedance 视频 | https://ark.cn-beijing.volces.com/api/v3 |
| Kling | 可灵视频生成 | https://api-beijing.klingai.com |
每个供应商支持:
api_key/access_key+secret_key(Kling 用了双密钥)base_url(可指向自部署代理)use_proxy开关(单个供应商可以独立走本地代理)local_proxy(如http://127.0.0.1:9090)
6.3 模板配置
默认视频模板:
template:
default_template: "1080x1920/image_default.html"
模板分三类(按命名前缀):
static_*.html:纯文字样式,无 AI 媒体(最便宜、最快)image_*.html:用 AI 配图做背景video_*.html:用 AI 视频做背景(效果最好,最贵)
6.4 进阶:自定义 ComfyUI 工作流
按 docs/zh/user-guide/workflows.md 文档规范:
- 在 ComfyUI 中设计好工作流
- 找到要动态传提示词的 Text 节点(CLIP Text Encode),把节点标题改成
$prompt.text!或$prompt.value! - 导出为 API 格式(Save → API Format)
- 放进
workflows/目录,命名遵守前缀:image_*.json:图像video_*.json:视频tts_*.json:语音
- Web 界面下拉菜单会自动出现这个新工作流
七、怎么用?完整流程
7.1 启动 → 创作的标准路径
Step 1:启动
- Windows:双击
start.bat - 源码:
uv run streamlit run web/app.py - Docker:
docker-compose up -d
浏览器自动打开 http://localhost:8501。
Step 2:首次配置(侧边栏"⚙️ 系统配置")
- LLM:选预设、填 API Key
- 媒体生成:填 ComfyUI URL 或 RunningHub Key / 选直连 API 供应商
Step 3:输入主题(左侧栏)
两种模式:
- AI 生成内容:输入主题("为什么要养成阅读习惯"),AI 自动写脚本
- 固定文案内容:直接粘贴写好的文案,可选按段落/行/句子自动分镜
Step 4:选语音 + 视觉(中间栏)
| 设置项 | 选项 |
|---|---|
| TTS 工作流 | Edge-TTS(默认免费)/ Index-TTS(支持声音克隆)/ Spark-TTS |
| 参考音频 | 上传 MP3/WAV/FLAC 即可克隆声线 |
| 图像/视频工作流 | FLUX / Qwen / SD3.5 / Z-Image / Nano Banana / WAN 2.1 等 |
| 图像尺寸 | 默认 1024×1024(可改) |
| Prompt Prefix | 控制画风,如"极简黑白火柴人风格" |
| 视频模板 | 按尺寸分组的下拉菜单,可视化预览 |
Step 5:生成视频(右侧栏)
点「🎬 生成视频」按钮,实时显示:
文案生成 → 分镜 1/N 生成插图 → ... → 合成语音 → 合成视频
5 个分镜的视频大约 2-5 分钟(官方数据)。
Step 6:预览 + 下载
生成完成自动在右侧播放,显示时长、文件大小、分镜数。视频保存在 output/ 目录。
7.2 进阶用法
1. 自定义视觉风格
文档:docs/zh/tutorials/custom-style.md
- 调整
prompt_prefix(英文),让所有配图保持统一风格
2. 声音克隆
文档:docs/zh/tutorials/voice-cloning.md
- 选支持声音克隆的 TTS 工作流(如
tts_index2.json) - 上传参考音频(建议 10-30 秒清晰人声)
- 输入测试文本点"预览语音"即可
3. 自定义模板
文档:docs/zh/user-guide/templates.md
- 复制
templates/1080x1920/下任一 HTML - 改 HTML/CSS,可用的 Jinja2 变量:
{{ title }}、{{ text }}、{{ image }} - 保存后 Web 界面下拉菜单自动出现
4. Python API 集成
文档:docs/zh/user-guide/api.md、FastAPI 服务在 8000 端口
from pixelle_video.service import PixelleVideoCore
import asyncio
async def main():
pixelle = PixelleVideoCore()
await pixelle.initialize()
result = await pixelle.generate_video(
text="为什么要养成阅读习惯",
mode="generate",
n_scenes=5
)
print(f"视频已生成: {result.video_path}")
asyncio.run(main())
八、典型应用场景
来自官方示例视频:
| 场景 | 模板类型 | 适合的 LLM | 成本 |
|---|---|---|---|
| 人文纪实 / 旅行 | image_default(竖屏) | Qwen | 低 |
| 文化解构 / 科普 | image_default | Qwen / GPT-4o | 低 |
| 个人成长 / 鸡汤 | image_elegant + 克隆音色 | DeepSeek | 极低 |
| 历史解说 | 自定义模板 | Qwen | 中 |
| 知识科普 | image_qwen 生图 | Qwen | 中 |
| 小说解说 | 自创脚本 | Qwen Max | 中 |
| 副业赚钱 | image_film(横屏) | GPT-4o | 中 |
| 数字人口播 | video_default | Qwen + DashScope Wan | 较高 |
| 图生视频 | video_* 模板 | Seedance / Kling | 高 |
| 动作迁移 | 自定义 | 需上传素材 | 高 |
九、背后团队 & 学术背景
AIDC-AI 团队背后是阿里达摩院系列研究。官方 README 列出了 4 篇顶会论文作为"系列工作":
- SIGGRAPH Asia 2024:FilmAgent: A Multi-Agent Collaborative Framework(多 Agent 协同自动拍电影)
- SIGGRAPH Asia 2024:Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation(可控动画)
- ACL 2025:ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development(ComfyUI 智能助手)
- SIGGRAPH Asia 2025:AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation(MCTS 驱动动画)
含义:这不是临时拼凑的项目,而是有学术研究 → 工程化落地的完整链路。学术质量背书 + 工业级工程化,二者兼具。
十、费用与限制
10.1 官方明确的费用方案
| 方案 | LLM | 图像/视频 | 单条 3 段视频成本 |
|---|---|---|---|
| 完全免费 | Ollama(本地) | 本地 ComfyUI | 0 元(需要 6GB+ 显存的 NVIDIA 显卡) |
| 推荐方案 | Qwen Max | 本地 ComfyUI | 约 0.01-0.05 元(官方数据) |
| 云端方案 | OpenAI | RunningHub 云端 | 较高(按 token + 算力计费) |
10.2 已知限制(来自官方 FAQ)
- Edge-TTS 不稳定:默认的 TTS 是调用微软免费接口,可能受网络影响;建议改用 ComfyUI 工作流(
tts_*.json) - 生成速度:5 分镜视频 2-5 分钟,主要瓶颈是图像/视频生成
- 磁盘占用:默认视频素材保存在
output/,需定期清理 - 依赖 Chrome 内核:部分功能(Playwright)需要安装 Google Chrome
- Windows 整合包 vs 源码:整合包已包含所有依赖(380 MB),源码安装需要自己配 Python 3.11 / ffmpeg / uv
十一、给想用的人的建议
- 对短视频/内容电商,这是 2026 年最值得关注的开源项目之一。半年涨到 2 万多星不是偶然。
- 零成本试用:Mac 装 Ollama(
brew install ollama)+ 下载源码,跑起来 30 分钟内可以见到效果。 - 生产化建议:Qwen + ComfyUI 本地 + Index-TTS(声音克隆)= 性价比最高的"日更 10 条短视频"工厂。
- 看团队能力选择:如果只做抖音/小红书口播号,Pixelle-Video 比 MoneyPrinterTurbo 强一代;如果要做电影级长视频,还得用 Pr/AE。
- 适合的延伸场景:商品讲解视频、客户案例视频、抖音种草短视频都可以半自动生产。