一、项目概述:当短视频创作变成一句话的事
做短视频最痛苦的是什么?写文案、找配图、录配音、剪辑、加字幕、调音乐……一个1分钟的视频,可能要折腾一整天。Pixelle-Video 正是为了解决这个痛点而诞生的。
Pixelle-Video 是阿里国际数字商业集团(AIDC-AI) 开源的 AI 全自动短视频引擎。它的定位极其简洁——只需输入一个主题,AI自动完成从文案到成片的全部流程。项目上线后迅速获得超过 2.5万 Star,Fork 数突破 3.5K,曾登上 GitHub Trending 第3位。
📌 项目地址:https://github.com/ATH-MaaS/Pixelle-Video
📌 开源协议:Apache-2.0
📌 技术栈:Python + ComfyUI + Streamlit
二、核心功能拆解
2.1 全自动生成流水线
Pixelle-Video 采用模块化 Pipeline 设计,将视频生成拆解为四个阶段:
① 文案生成 → 用户输入主题,LLM 自动生成结构化解说词,并拆分为分镜
② 配图规划 → 为每个分镜生成对应的 AI 配图或视频片段
③ 语音合成 → TTS 引擎将文案转为语音解说
④ 视频合成 → 拼接所有素材 + 添加 BGM,输出完整 MP4
2.2 功能亮点一览
| 功能模块 | 说明 |
|---|---|
| AI 智能文案 | 支持通义千问、GPT、DeepSeek、Ollama 等多种 LLM |
| AI 生成配图 | 每句话配 AI 插图,支持 FLUX、SDXL 等模型 |
| AI 生成视频 | 支持 WAN 2.1 等视频生成模型 |
| AI 生成语音 | 支持 Edge-TTS、Index-TTS、Chat-TTS 等 |
| 背景音乐 | 内置 BGM 库,支持自定义音乐 |
| 视觉风格 | 多种模板可选,支持竖屏/横屏/方形 |
| 直连模型 API | 直接调用 DashScope、OpenAI、Kling 等服务 |
2.3 近期重要更新(2025-2026)
- 2026-06-01:新增直连 API 媒体模型配置,支持在 WebUI 中配置图像/视频模型供应商
- 2026-01-26:新增「动作迁移」模块
- 2026-01-14:新增「数字人口播」和「图生视频」流水线
- 2025-12-05:新增 Windows 整合包下载
- 2025-12-04:新增「自定义素材」功能
- 2025-11-18:新增历史记录页面,支持批量创建视频任务
三、安装教程
方式一:Windows 一键整合包(⭐推荐新手)
这是最简单的方式,不需要安装 Python、uv 或 ffmpeg,整合包已包含所有依赖。
步骤:
- 前往 GitHub Release 页面下载 Windows 整合包
- 解压到任意文件夹
- 双击运行
start.bat - 浏览器自动打开
http://localhost:8501
方式二:源码安装(适合 Mac / Linux / 进阶用户)
Step 0:安装前置依赖
安装 uv(Python 包管理器):
# macOS brew install uv # 或参考官方文档:https://docs.astral.sh/uv/
安装 ffmpeg(视频处理工具):
# macOS brew install ffmpeg # Ubuntu / Debian sudo apt update && sudo apt install ffmpeg # Windows:下载后手动添加 bin 目录到系统 PATH
Step 1:克隆项目
git clone https://github.com/AIDC-AI/Pixelle-Video.git cd Pixelle-Video
Step 2:启动 Web 界面
uv run streamlit run web/app.py
浏览器访问 http://localhost:8501
方式三:Docker 部署(适合服务器/隔离环境)
git clone https://github.com/AIDC-AI/Pixelle-Video.git cd Pixelle-Video # 国内用户建议开启镜像加速 set USE_CN_MIRROR=true && docker compose build --no-cache set USE_CN_MIRROR=true && docker compose up -d
四、使用教程
4.1 首次配置(关键步骤)
进入 Web 界面后,展开左侧 「⚙️ 系统配置」 面板:
① LLM 配置(文案生成)
- 从下拉菜单选择模型(通义千问、GPT-4、DeepSeek 等)
- 点击“获取 API Key”注册并填入
- 也可手动填写 Base URL 和 Model 名称
② 图像/视频配置(配图生成)
- 本地部署:连接本地 ComfyUI 服务,完全免费
- 云端部署:使用 RunningHub,无需本地显卡
💡 零成本方案:使用 RunningHub 注册可获免费额度
配置完成后点击 “保存配置” ,后续无需重复配置。
4.2 生成视频(三步搞定)
第一步:输入内容
- AI 生成内容:输入主题关键词(如“为什么要养成阅读习惯”)
- 固定文案内容:已有现成文案可直接粘贴
第二步:视觉与音频设置
- 选择 BGM(内置/自定义/无)
- 设置视频尺寸(竖屏/横屏/方形)
- 输入英文提示词控制配图风格
第三步:点击生成
- 点击右侧 “生成视频” 按钮
- 系统自动执行全流程,实时显示进度
- 生成完成后在
output/文件夹中找到视频文件
4.3 进阶功能
- 历史记录:查看所有生成任务,支持重新预览、删除或重新生成
- 自定义素材:上传自己的照片和视频,AI 智能分析生成脚本
- 动作迁移:上传参考视频和图片进行动作迁移
- 数字人口播:生成带有数字人形象的播报视频
五、实用建议
5.1 新手避坑指南
- API Key 是必须的:LLM 和图像生成都需要 API Key,没有的话无法工作
- 首次配置后记得保存:忘记保存配置会导致生成失败
- TTS 不稳定时可锁定版本:如遇 Edge-TTS 问题,可参考官方锁定版本方案
- 国内用户建议开启镜像:Docker 部署时设置
USE_CN_MIRROR=true
5.2 最佳实践
- 文案风格:不同 LLM 生成的文案风格不同,多尝试找到最适合的模型
- 配图提示词:使用英文提示词控制风格,效果更精准
- 模板选择:静态模板适合纯口播,图片/视频模板适合图文/动态内容
- 批量生产:利用历史记录和批量创建功能,可实现日更多条视频
5.3 适用场景
- 知识类短视频(历史、科学、财经、生活技巧)
- 自媒体矩阵批量内容生产
- 创意快速验证,低成本试水话题
- 私有化部署场景,数据不出本地
六、总结
Pixelle-Video 的核心价值在于将短视频创作的门槛降到了极致——你不需要会写文案、不需要会剪辑、不需要会配音,甚至不需要有任何视频制作经验。它本质上一个“调度中心”,优雅地指挥外部的 AI 模型为你效劳。
如果你正在寻找一个免费、开源、可本地部署的 AI 视频自动化工具,Pixelle-Video 值得一试。
数据统计
数据评估
关于Pixelle-Video特别声明
本站微企脉提供的Pixelle-Video都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由微企脉实际控制,在2026年8月30日 下午8:53收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,微企脉不承担任何责任。
相关导航
Raphael AI 是一个完全免费、无需注册、无限生成的AI图像平台,口号是“全球首个无限免费AI图像生成器”。其核心优势在于场景感知智能路由,系统会根据你的提示,自动在 Z-Image、Flux 2、Qwen-Image、Nano Banana Pro 等先进模型中选择最合适的一个,兼顾质量与速度。
Free Claude Code
Free Claude Code 是一个开源的本地代理服务器,将 Claude Code 客户端发出的 Anthropic Messages API 请求拦截并重定向到你自行配置的后端模型服务上。简单说:你继续用 Claude Code 的终端、VS Code 扩展或 JetBrains 插件,流量可以不走官方 API,而是走 NVIDIA NIM、OpenRouter、DeepSeek、Gemini 甚至本地的 Ollama、LM Studio。
ego (lite)
ego (lite) 是由 Citro Labs 开发的一款基于 Chromium 内核的浏览器,它的核心定位非常直接:一个让你和 AI Agent 可以同时使用的浏览器。你在前台刷网页,Agent 在独立的 Space 里跑任务——同一个 Chromium 内核,两套完全独立的工作空间,互不干扰。
识典古籍
识典古籍是一个由北京大学和字节跳动联合共建的公益性古籍数字化平台,致力于利用AI技术让珍贵古籍“活”起来,免费向公众开放。它不仅仅是一个在线阅读网站,更是一个集阅读、研究、整理于一体的智能化平台。
SnapAny
SnapAny是一个免费的在线及桌面端多媒体下载工具,主打从上千个网站一键保存视频和图片。支持包括YouTube、抖音、Bilibili、TikTok、Facebook、Pinterest等主流国内外平台。
Prism Browser Community
Prism Browser Community 是一个基于定制 Chromium 的本地指纹浏览器环境管理器,与传统多开浏览器不同,Prism 为每个浏览器环境提供独立的 Cookie、缓存、扩展数据、代理设置和指纹配置,实现多账号隔离管理,且所有数据默认只保存在用户自己的设备上。项目的核心定位是 Local-first(本地优先) ——Community 版本完全免费,且不限制本地环境数量。
Firecrawl
Firecrawl是一个将网站内容转化为适用于大型语言模型(LLM)的干净数据的开发平台。它是一款开源、开发者优先的 API 服务,旨在为 AI 应用和智能体(Agent)提供可靠的网页数据 。
MultiPost
MultiPost 是一款开源的多平台社交媒体内容发布工具,以浏览器扩展为主要形态,帮助用户将文本、图片、视频等内容一键同步发布到多个平台。无需登录、无需注册、无需申请 API Key。它不经过任何第三方服务器中转你的内容,所有操作都在你的浏览器本地完成。
Wormhole
wormhole专注于普通用户间安全、私密传输大文件的免费工具网站。无需注册,直接通过浏览器端到端加密分享最大10GB的文件,并生成可设置自动过期的链接。
Camofox-Browser
Camofox-browser 是一个基于 Firefox C++ 引擎级指纹伪装的 AI Agent 反检测浏览器服务器,能绕过 Cloudflare、Google 等主流反爬系统,让 AI 智能体像真人一样浏览网页。Camofox-Browser 是一个专为 AI Agent(AI 智能体) 设计的反检测浏览器服务器,由 jo-inc 团队开发。它基于 Camoufox——一个在 C++ 引擎层面进行指纹伪造的 Firefox 分支——构建而成。

潇楠 · Web3 哨兵
潇楠Web3哨兵是一款桌面端+网页版双端覆盖的专业级Web3监控与交易系统。它的核心定位是:帮你从“被动查链”变成“主动感知链上动态”,同时把发现机会→评估风险→完成交易的闭环全部放在一个软件里完成。

公众号陪玩树洞系统源码
玩创公众号陪玩树洞系统,基于 FastAdmin 框架开发,可快速搭建公众号 + H5 陪玩平台。系统支持微信授权、全流程运营、多支付对接、智能派单及消息推送,后台可高度自定义,提供源码、教程与技术协助,零基础即可部署上线。
暂无评论...






