文档大纲

日更10条短视频不喊累:阿里开源Pixelle-Video实测,写文案到出片只要5分钟

阿里达摩院孵化的 AIDC-AI 团队开源了 Pixelle-Video——你只要输入一个主题,AI 自动完成"写文案→配图/视频→配音→配 BGM→合成"整条流水线,几分钟产出一条完整短视频。半年 21,751 星,Apache 2.0 可商用。

最近看到一个让人坐不住的项目:Pixelle-Video。

它的玩法很简单——你只要给它一个主题(比如"为什么要养成阅读习惯"),点一下按钮,几分钟之后它就给你吐出一条完整的短视频。文案、配图、配音、BGM、字幕、动效全搞定,你连剪辑软件都不用开。

官方原话:"零门槛,零剪辑经验,让视频创作成为一句话的事。"

听起来像噱头?我去翻了它 GitHub 上 21,751 颗星背后的真实数据,把它和同类项目做了个交叉对比,给你完整拆解这套"AI 短视频印钞机"到底能不能用、值不值得用。

一、项目概况:阿里达摩院出的,半年破 2 万星

项目属性详情
仓库地址github.com/AIDC-AI/Pixelle-Video
所属组织AIDC-AI(阿里达摩院孵化的 AI 团队)
SloganAI 全自动短视频引擎
开源协议Apache License 2.0(可商用、需保留版权)
项目语言Python(≥ 3.11)
首次提交2025-11-07
最新版本v0.1.15(2026-01-27)
Stars / Forks21,751 / 3,060(增长速度极快,半年破 2 万星)
主要标签aigc、comfyui、image-generation、tts、video-generation
官方文档aidc-ai.github.io/Pixelle-Video/zh
视频教程B 站 BV1WzyGBnEVp

一句话定义:你只需要给它一个主题关键词,它就能自动完成"写文案 → 配图/视频 → 配音 → 配 BGM → 合成视频"整条流水线,把一段短视频像印钞一样批量产出来。

二、它到底能干什么?

2.1 核心能力:输入一句话,输出一条视频

按官方 README 的标准流程,整个自动化流水线是这样跑的:

输入主题(比如"为什么要养成阅读习惯")
  ↓
AI 自动撰写视频文案(多段解说词)
  ↓
为每句文案匹配 AI 配图(或 AI 视频片段)
  ↓
用 TTS 把文案合成语音解说
  ↓
添加背景音乐
  ↓
套上视频模板(字幕、动效、画面布局)
  ↓
一键合成最终短视频

整个过程你只需要在 Web 界面里输入主题、点一下按钮。

2.2 能力清单(来自官方 README 的"功能亮点")

  • ✅ 全自动生成:输入主题,几分钟出一条完整视频
  • ✅ AI 智能文案:自动写脚本
  • ✅ AI 生成配图:支持 FLUX、Qwen、SD3.5、SDXL、Z-Image、Nano Banana 等多种图像模型
  • ✅ AI 生成视频:支持 WAN 2.1、WAN 2.2、LTX2、Seedance、HappyHorse 等视频模型
  • ✅ 直连模型 API:不用本地跑 ComfyUI,直接调用 DashScope、OpenAI、ARK、Kling 等
  • ✅ AI 生成语音:支持 Edge-TTS、Index-TTS(支持声音克隆)、Spark-TTS
  • ✅ 背景音乐:内置 BGM 库,支持自定义
  • ✅ 视觉风格:20+ 预设模板(抖音风、电影风、治愈系、卡通、复古等)
  • ✅ 灵活尺寸:竖屏 1080×1920(抖音/小红书)、横屏 1920×1080(B 站/YouTube)、方形 1080×1080(朋友圈)
  • ✅ 多 LLM 切换:Qwen、GPT-4o、Claude Sonnet 4.5、DeepSeek、Ollama、Moonshot
  • ✅ 原子能力灵活组合:图像、视频、TTS、VLM 都可以单独替换

2.3 进阶模块(2026 年 Q1 上线)

  • 👤 数字人口播:让 AI 数字人讲解内容(已支持韩语等多语言)
  • 🖼️ 图生视频:上传一张图片,让它动起来
  • 💃 动作迁移:上传参考视频和图片,让图片里的人物"复制"参考视频的动作(跳舞的小猫就是典型案例)
  • 🎨 自定义素材:上传自己的照片/视频,AI 智能分析生成脚本

2.4 它解决了什么商业问题?

痛点Pixelle-Video 的解法
短视频日更压力大输入主题就出片,产能放大 10 倍
不会写脚本6 个主流 LLM 随选,AI 自动写
不会用 PR/AEWeb 界面点点点就行
配音贵/不自然内置 Edge-TTS 免费 + Index-TTS 可声音克隆
模板风格单一20+ 模板,覆盖各垂类
担心被云服务绑定全栈开源、Apache 2.0、可商用、可私有部署

一句话总结:它把"短视频生产"从"手艺活"变成了"流水线",是 AIGC 时代的内容生产工具。

三、适合谁用?6 类典型用户

官方没有明确列"目标用户",但从功能矩阵、模板分类、文档教程反推,最适合以下 6 类人:

3.1 自媒体短视频创作者

知识科普、情感语录、励志鸡汤、书单号、历史解说等"口播+配图"型账号。官方 README 展示的 9 个案例视频中 6 个是这种类型。

3.2 MCN 机构 / 内容工作室

需要日更多条视频、把单条视频成本从几十块压到几分钱。同一主题可以批量生成多个变体。

3.3 电商运营

商品讲解视频自动生成("养生知识"、"健康饮食"模板已展示)。跨境电商的多语言视频(数字人口播支持多语言)。

3.4 教育/培训行业

课程视频、知识点科普("科学思辨"、"个人成长"模板)。企业内训视频批量制作。

3.5 个人开发者 / AI 工具爱好者

二次开发:在 Pixelle-Video 基础上做定制。研究:背后是 SIGGRAPH Asia 学术项目(FilmAgent、Anim-Director、AniMaker)。

3.6 不想被国外 SaaS 绑架、又想要 AIGC 能力的团队

全栈开源 + Apache 2.0 = 可商用、可私有化、可二开。

3.7 不适合谁?

  • 需要电影级专业剪辑的(Pr/AE 仍是首选)
  • 需要实时直播数字人(它是离线生成,不是实时驱动)
  • 完全没有显卡也不愿付费云端 API 的(虽然有完全免费方案,但 Ollama 本地推理需要算力)

四、和相似项目怎么比?

官方 README 明确列出了 5 个参考/启发项目,我把它们和 Pixelle-Video 做一张对比表(信息全部来自各项目官方仓库和 Pixelle-Video 官方说明):

项目主要定位与 Pixelle-Video 的差异
Pixelle-MCP(AIDC-AI 自家)ComfyUI 的 MCP 服务器,让 AI 助手直接调用 ComfyUI基础设施层;Pixelle-Video 是它的"上层应用"
MoneyPrinterTurbo(harry0703)较早一批的 AI 视频生成工具功能较单一,扩展性弱;Pixelle-Video 基于 ComfyUI 架构,可替换任何环节
NarratoAI(linyqh)影视解说自动化工具专注解说垂类;Pixelle-Video 是通用平台,覆盖更广
MoneyPrinterPlus(ddean2009)视频创作平台综合工具;Pixelle-Video 把所有"原子能力"(LLM/图像/视频/TTS)模块化
ComfyKit(puke3615)ComfyUI 工作流封装库底层依赖库;Pixelle-Video 直接使用 ComfyKit 作为 ComfyUI 调度器

官方原文:"Pixelle-Video 的设计受到以下优秀开源项目的启发",并致谢这些项目。

4.1 Pixelle-Video 的差异化优势

  1. 架构更现代:基于 ComfyUI 的"工作流"机制,可以精确控制每一步的模型/参数,不像早期项目是"黑盒串联"
  2. 原子化设计:LLM / TTS / 图像 / 视频 / VLM 五大能力完全可替换,技术债最低
  3. 三种部署路径:本地 ComfyUI / 云端 RunningHub / 直连 API(OpenAI/DashScope/Kling/ARK),灵活度最高
  4. 学术背书:背后是 AIDC-AI 团队 SIGGRAPH Asia 2024/2025 的系列论文(FilmAgent、Anim-Director、AniMaker),不是临时攒的项目
  5. 可商用:Apache 2.0,不像部分项目是 AGPL/MIT 限制

五、怎么部署?三种方式 + 资源清单

5.1 方式 A:Windows 一键整合包(最省事)

适合:Windows 用户、想 5 分钟跑起来

  1. 到 releases/latest 下载最新整合包(v0.1.15 的 zip 是 380 MB)
  2. 解压到任意目录
  3. 双击 start.bat
  4. 浏览器自动打开 http://localhost:8501
  5. 在"⚙️ 系统配置"里填 API Key,开始生成

零依赖:Python、uv、ffmpeg 都打包在内。

5.2 方式 B:源码安装(macOS / Linux)

适合:开发者、想自定义

前置环境:

  • Python ≥ 3.11(pyproject.toml 中 requires-python = ">=3.11",注意 installation.md 写的是 3.10+)
  • ffmpeg(macOS 用 brew install ffmpeg,Ubuntu 用 sudo apt install ffmpeg)
  • uv(包管理器):curl -LsSf https://astral.sh/uv/install.sh | sh

步骤:

git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video
uv sync                              # 自动装依赖
uv run streamlit run web/app.py      # 启动 Web(端口 8501)

5.3 方式 C:Docker 部署(生产环境推荐)

适合:服务器部署、长期运行

前置:Docker + Docker Compose

git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video
# 国内环境用清华镜像加速构建
USE_CN_MIRROR=true docker-compose up -d

启动后有两个服务:

  • API 服务:FastAPI,端口 8000(/health 端点做健康检查)
  • Web UI:Streamlit,端口 8501

docker-compose.yml 已经做好:

  • 配置自动初始化(init 服务从 config.example.yaml 复制出 config.yaml)
  • 数据持久化(./data、./output 挂载到容器)
  • 健康检查 + 自动重启
  • 时区设置 Asia/Shanghai

5.4 系统资源要求

资源最低推荐
操作系统Windows 10 / macOS 11 / Ubuntu 20.04较新系统
Python3.113.11+
内存4 GB8 GB+
硬盘5 GB(不含模型)20 GB+(含 ComfyUI 模型)
GPU可选NVIDIA 6GB+ 显存(仅本地 ComfyUI 需要)
网络稳定稳定(云端 API 需要)

六、怎么配置?

配置文件路径:config.yaml(从 config.example.yaml 复制)。下面是配置结构的中文解读,全部内容来自官方配置示例:

6.1 LLM 配置(必填)

写视频文案用的大模型。支持任何兼容 OpenAI SDK 协议的 API。

官方预设了 6 个(来自 pixelle_video/llm_presets.py):

名称base_urlmodel备注
Qwen(推荐)https://dashscope.aliyuncs.com/compatible-mode/v1qwen-max国内性价比高
OpenAIhttps://api.openai.com/v1gpt-4o需科学上网
Claudehttps://api.anthropic.com/v1/claude-sonnet-4-5需科学上网
DeepSeekhttps://api.deepseek.comdeepseek-chat国内便宜
Ollamahttp://localhost:11434/v1llama3.2本地免费
Moonshot(月之暗面)https://api.moonshot.cn/v1moonshot-v1-8k长文本

Web 界面的下拉菜单可以直接选预设,会自动填 base_url 和 model,你只需要填 api_key。

6.2 媒体生成配置(二选一)

两条路径:

路径 A:ComfyUI(工作流派)

  • 适合:想精细控制、可本地部署
  • 需要:本地起 ComfyUI 服务(默认端口 8188),或注册 RunningHub 云端账号
  • RunningHub 还支持 24GB / 48GB 显存机器切换、并发限制(1-10)

路径 B:直连 API(最省事)

官方配置示例里直接列了 4 家供应商:

供应商用途默认 base_url
OpenAIGPT Image 系列https://api.openai.com/v1
DashScope通义万象 Wan 视频、HappyHorse 视频、Qwen 图像https://dashscope.aliyuncs.com/api/v1
Volcengine ARK字节 Seedream 图像、Seedance 视频https://ark.cn-beijing.volces.com/api/v3
Kling可灵视频生成https://api-beijing.klingai.com

每个供应商支持:

  • api_key / access_key + secret_key(Kling 用了双密钥)
  • base_url(可指向自部署代理)
  • use_proxy 开关(单个供应商可以独立走本地代理)
  • local_proxy(如 http://127.0.0.1:9090)

6.3 模板配置

默认视频模板:

template:
  default_template: "1080x1920/image_default.html"

模板分三类(按命名前缀):

  • static_*.html:纯文字样式,无 AI 媒体(最便宜、最快)
  • image_*.html:用 AI 配图做背景
  • video_*.html:用 AI 视频做背景(效果最好,最贵)

6.4 进阶:自定义 ComfyUI 工作流

按 docs/zh/user-guide/workflows.md 文档规范:

  1. 在 ComfyUI 中设计好工作流
  2. 找到要动态传提示词的 Text 节点(CLIP Text Encode),把节点标题改成 $prompt.text! 或 $prompt.value!
  3. 导出为 API 格式(Save → API Format)
  4. 放进 workflows/ 目录,命名遵守前缀:
    • image_*.json:图像
    • video_*.json:视频
    • tts_*.json:语音
  5. Web 界面下拉菜单会自动出现这个新工作流

七、怎么用?完整流程

7.1 启动 → 创作的标准路径

Step 1:启动

  • Windows:双击 start.bat
  • 源码:uv run streamlit run web/app.py
  • Docker:docker-compose up -d

浏览器自动打开 http://localhost:8501。

Step 2:首次配置(侧边栏"⚙️ 系统配置")

  • LLM:选预设、填 API Key
  • 媒体生成:填 ComfyUI URL 或 RunningHub Key / 选直连 API 供应商

Step 3:输入主题(左侧栏)

两种模式:

  • AI 生成内容:输入主题("为什么要养成阅读习惯"),AI 自动写脚本
  • 固定文案内容:直接粘贴写好的文案,可选按段落/行/句子自动分镜

Step 4:选语音 + 视觉(中间栏)

设置项选项
TTS 工作流Edge-TTS(默认免费)/ Index-TTS(支持声音克隆)/ Spark-TTS
参考音频上传 MP3/WAV/FLAC 即可克隆声线
图像/视频工作流FLUX / Qwen / SD3.5 / Z-Image / Nano Banana / WAN 2.1 等
图像尺寸默认 1024×1024(可改)
Prompt Prefix控制画风,如"极简黑白火柴人风格"
视频模板按尺寸分组的下拉菜单,可视化预览

Step 5:生成视频(右侧栏)

点「🎬 生成视频」按钮,实时显示:

文案生成 → 分镜 1/N 生成插图 → ... → 合成语音 → 合成视频

5 个分镜的视频大约 2-5 分钟(官方数据)。

Step 6:预览 + 下载

生成完成自动在右侧播放,显示时长、文件大小、分镜数。视频保存在 output/ 目录。

7.2 进阶用法

1. 自定义视觉风格

文档:docs/zh/tutorials/custom-style.md

  • 调整 prompt_prefix(英文),让所有配图保持统一风格

2. 声音克隆

文档:docs/zh/tutorials/voice-cloning.md

  • 选支持声音克隆的 TTS 工作流(如 tts_index2.json)
  • 上传参考音频(建议 10-30 秒清晰人声)
  • 输入测试文本点"预览语音"即可

3. 自定义模板

文档:docs/zh/user-guide/templates.md

  • 复制 templates/1080x1920/ 下任一 HTML
  • 改 HTML/CSS,可用的 Jinja2 变量:{{ title }}、{{ text }}、{{ image }}
  • 保存后 Web 界面下拉菜单自动出现

4. Python API 集成

文档:docs/zh/user-guide/api.md、FastAPI 服务在 8000 端口

from pixelle_video.service import PixelleVideoCore
import asyncio

async def main():
    pixelle = PixelleVideoCore()
    await pixelle.initialize()
    result = await pixelle.generate_video(
        text="为什么要养成阅读习惯",
        mode="generate",
        n_scenes=5
    )
    print(f"视频已生成: {result.video_path}")

asyncio.run(main())

八、典型应用场景

来自官方示例视频:

场景模板类型适合的 LLM成本
人文纪实 / 旅行image_default(竖屏)Qwen低
文化解构 / 科普image_defaultQwen / GPT-4o低
个人成长 / 鸡汤image_elegant + 克隆音色DeepSeek极低
历史解说自定义模板Qwen中
知识科普image_qwen 生图Qwen中
小说解说自创脚本Qwen Max中
副业赚钱image_film(横屏)GPT-4o中
数字人口播video_defaultQwen + DashScope Wan较高
图生视频video_* 模板Seedance / Kling高
动作迁移自定义需上传素材高

九、背后团队 & 学术背景

AIDC-AI 团队背后是阿里达摩院系列研究。官方 README 列出了 4 篇顶会论文作为"系列工作":

  1. SIGGRAPH Asia 2024:FilmAgent: A Multi-Agent Collaborative Framework(多 Agent 协同自动拍电影)
  2. SIGGRAPH Asia 2024:Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation(可控动画)
  3. ACL 2025:ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development(ComfyUI 智能助手)
  4. SIGGRAPH Asia 2025:AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation(MCTS 驱动动画)

含义:这不是临时拼凑的项目,而是有学术研究 → 工程化落地的完整链路。学术质量背书 + 工业级工程化,二者兼具。

十、费用与限制

10.1 官方明确的费用方案

方案LLM图像/视频单条 3 段视频成本
完全免费Ollama(本地)本地 ComfyUI0 元(需要 6GB+ 显存的 NVIDIA 显卡)
推荐方案Qwen Max本地 ComfyUI约 0.01-0.05 元(官方数据)
云端方案OpenAIRunningHub 云端较高(按 token + 算力计费)

10.2 已知限制(来自官方 FAQ)

  • Edge-TTS 不稳定:默认的 TTS 是调用微软免费接口,可能受网络影响;建议改用 ComfyUI 工作流(tts_*.json)
  • 生成速度:5 分镜视频 2-5 分钟,主要瓶颈是图像/视频生成
  • 磁盘占用:默认视频素材保存在 output/,需定期清理
  • 依赖 Chrome 内核:部分功能(Playwright)需要安装 Google Chrome
  • Windows 整合包 vs 源码:整合包已包含所有依赖(380 MB),源码安装需要自己配 Python 3.11 / ffmpeg / uv

十一、给想用的人的建议

  1. 对短视频/内容电商,这是 2026 年最值得关注的开源项目之一。半年涨到 2 万多星不是偶然。
  2. 零成本试用:Mac 装 Ollama(brew install ollama)+ 下载源码,跑起来 30 分钟内可以见到效果。
  3. 生产化建议:Qwen + ComfyUI 本地 + Index-TTS(声音克隆)= 性价比最高的"日更 10 条短视频"工厂。
  4. 看团队能力选择:如果只做抖音/小红书口播号,Pixelle-Video 比 MoneyPrinterTurbo 强一代;如果要做电影级长视频,还得用 Pr/AE。
  5. 适合的延伸场景:商品讲解视频、客户案例视频、抖音种草短视频都可以半自动生产。
阅读量: 302