一、项目概述:当短视频创作变成一句话的事
做短视频最痛苦的是什么?写文案、找配图、录配音、剪辑、加字幕、调音乐……一个1分钟的视频,可能要折腾一整天。Pixelle-Video 正是为了解决这个痛点而诞生的。
Pixelle-Video 是阿里国际数字商业集团(AIDC-AI) 开源的 AI 全自动短视频引擎。它的定位极其简洁——只需输入一个主题,AI自动完成从文案到成片的全部流程。项目上线后迅速获得超过 2.5万 Star,Fork 数突破 3.5K,曾登上 GitHub Trending 第3位。
📌 项目地址:https://github.com/ATH-MaaS/Pixelle-Video
📌 开源协议:Apache-2.0
📌 技术栈:Python + ComfyUI + Streamlit
二、核心功能拆解
2.1 全自动生成流水线
Pixelle-Video 采用模块化 Pipeline 设计,将视频生成拆解为四个阶段:
① 文案生成 → 用户输入主题,LLM 自动生成结构化解说词,并拆分为分镜
② 配图规划 → 为每个分镜生成对应的 AI 配图或视频片段
③ 语音合成 → TTS 引擎将文案转为语音解说
④ 视频合成 → 拼接所有素材 + 添加 BGM,输出完整 MP4
2.2 功能亮点一览
| 功能模块 | 说明 |
|---|---|
| AI 智能文案 | 支持通义千问、GPT、DeepSeek、Ollama 等多种 LLM |
| AI 生成配图 | 每句话配 AI 插图,支持 FLUX、SDXL 等模型 |
| AI 生成视频 | 支持 WAN 2.1 等视频生成模型 |
| AI 生成语音 | 支持 Edge-TTS、Index-TTS、Chat-TTS 等 |
| 背景音乐 | 内置 BGM 库,支持自定义音乐 |
| 视觉风格 | 多种模板可选,支持竖屏/横屏/方形 |
| 直连模型 API | 直接调用 DashScope、OpenAI、Kling 等服务 |
2.3 近期重要更新(2025-2026)
- 2026-06-01:新增直连 API 媒体模型配置,支持在 WebUI 中配置图像/视频模型供应商
- 2026-01-26:新增「动作迁移」模块
- 2026-01-14:新增「数字人口播」和「图生视频」流水线
- 2025-12-05:新增 Windows 整合包下载
- 2025-12-04:新增「自定义素材」功能
- 2025-11-18:新增历史记录页面,支持批量创建视频任务
三、安装教程
方式一:Windows 一键整合包(⭐推荐新手)
这是最简单的方式,不需要安装 Python、uv 或 ffmpeg,整合包已包含所有依赖。
步骤:
- 前往 GitHub Release 页面下载 Windows 整合包
- 解压到任意文件夹
- 双击运行
start.bat - 浏览器自动打开
http://localhost:8501
方式二:源码安装(适合 Mac / Linux / 进阶用户)
Step 0:安装前置依赖
安装 uv(Python 包管理器):
# macOS brew install uv # 或参考官方文档:https://docs.astral.sh/uv/
安装 ffmpeg(视频处理工具):
# macOS brew install ffmpeg # Ubuntu / Debian sudo apt update && sudo apt install ffmpeg # Windows:下载后手动添加 bin 目录到系统 PATH
Step 1:克隆项目
git clone https://github.com/AIDC-AI/Pixelle-Video.git cd Pixelle-Video
Step 2:启动 Web 界面
uv run streamlit run web/app.py
浏览器访问 http://localhost:8501
方式三:Docker 部署(适合服务器/隔离环境)
git clone https://github.com/AIDC-AI/Pixelle-Video.git cd Pixelle-Video # 国内用户建议开启镜像加速 set USE_CN_MIRROR=true && docker compose build --no-cache set USE_CN_MIRROR=true && docker compose up -d
四、使用教程
4.1 首次配置(关键步骤)
进入 Web 界面后,展开左侧 「⚙️ 系统配置」 面板:
① LLM 配置(文案生成)
- 从下拉菜单选择模型(通义千问、GPT-4、DeepSeek 等)
- 点击“获取 API Key”注册并填入
- 也可手动填写 Base URL 和 Model 名称
② 图像/视频配置(配图生成)
- 本地部署:连接本地 ComfyUI 服务,完全免费
- 云端部署:使用 RunningHub,无需本地显卡
💡 零成本方案:使用 RunningHub 注册可获免费额度
配置完成后点击 “保存配置” ,后续无需重复配置。
4.2 生成视频(三步搞定)
第一步:输入内容
- AI 生成内容:输入主题关键词(如“为什么要养成阅读习惯”)
- 固定文案内容:已有现成文案可直接粘贴
第二步:视觉与音频设置
- 选择 BGM(内置/自定义/无)
- 设置视频尺寸(竖屏/横屏/方形)
- 输入英文提示词控制配图风格
第三步:点击生成
- 点击右侧 “生成视频” 按钮
- 系统自动执行全流程,实时显示进度
- 生成完成后在
output/文件夹中找到视频文件
4.3 进阶功能
- 历史记录:查看所有生成任务,支持重新预览、删除或重新生成
- 自定义素材:上传自己的照片和视频,AI 智能分析生成脚本
- 动作迁移:上传参考视频和图片进行动作迁移
- 数字人口播:生成带有数字人形象的播报视频
五、实用建议
5.1 新手避坑指南
- API Key 是必须的:LLM 和图像生成都需要 API Key,没有的话无法工作
- 首次配置后记得保存:忘记保存配置会导致生成失败
- TTS 不稳定时可锁定版本:如遇 Edge-TTS 问题,可参考官方锁定版本方案
- 国内用户建议开启镜像:Docker 部署时设置
USE_CN_MIRROR=true
5.2 最佳实践
- 文案风格:不同 LLM 生成的文案风格不同,多尝试找到最适合的模型
- 配图提示词:使用英文提示词控制风格,效果更精准
- 模板选择:静态模板适合纯口播,图片/视频模板适合图文/动态内容
- 批量生产:利用历史记录和批量创建功能,可实现日更多条视频
5.3 适用场景
- 知识类短视频(历史、科学、财经、生活技巧)
- 自媒体矩阵批量内容生产
- 创意快速验证,低成本试水话题
- 私有化部署场景,数据不出本地
六、总结
Pixelle-Video 的核心价值在于将短视频创作的门槛降到了极致——你不需要会写文案、不需要会剪辑、不需要会配音,甚至不需要有任何视频制作经验。它本质上一个“调度中心”,优雅地指挥外部的 AI 模型为你效劳。
如果你正在寻找一个免费、开源、可本地部署的 AI 视频自动化工具,Pixelle-Video 值得一试。
数据统计
数据评估
关于Pixelle-Video特别声明
本站微企脉提供的Pixelle-Video都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由微企脉实际控制,在2026年8月30日 下午8:53收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,微企脉不承担任何责任。
相关导航
SoBooks是一个专注于免费电子书资源分享的国内网站,网站定位十分清晰——主要面向中文电子书阅读爱好者,提供小说文学、历史传记、人文社科、励志成功、经济管理、学习教育、生活时尚、漫画绘本等分类的电子书下载服务。主要提供 EPUB、MOBI、AZW3 等主流格式的电子书,完美适配 Kindle、Kobo、手机阅读 App。
AI Self-Media Tools
AI Self-Media Tools是目前开源社区中最完整的自媒体多平台运营工作流工具。它不是又一个“提示词套壳”产品,而是一套工程化、可审计、可复用的内容运营基础设施。对于真正想要实现“一人成军”的创作者来说,值得投入15分钟完成安装部署,开启效率革命。
AIGCTrace
AIGCTrace是一款专注于 AI 生成内容(AIGC)图片溯源检测的在线工具。用户上传一张图片后,平台在数秒内完成检测,输出 0–100 的综合风险评分,并给出各项指标的具体置信度。平台无需注册、不保存用户上传的图片、完全免费使用,同时支持 TC260 国标(《网络安全技术 人工智能生成合成内容标识方法》),与国内监管合规要求保持同步。
Free Claude Code
Free Claude Code 是一个开源的本地代理服务器,将 Claude Code 客户端发出的 Anthropic Messages API 请求拦截并重定向到你自行配置的后端模型服务上。简单说:你继续用 Claude Code 的终端、VS Code 扩展或 JetBrains 插件,流量可以不走官方 API,而是走 NVIDIA NIM、OpenRouter、DeepSeek、Gemini 甚至本地的 Ollama、LM Studio。
ego (lite)
ego (lite) 是由 Citro Labs 开发的一款基于 Chromium 内核的浏览器,它的核心定位非常直接:一个让你和 AI Agent 可以同时使用的浏览器。你在前台刷网页,Agent 在独立的 Space 里跑任务——同一个 Chromium 内核,两套完全独立的工作空间,互不干扰。
CyberVerse
CyberVerse是一个开源的实时数字人Agent框架,由Lynpoint团队开发并托管在GitHub上。它基于WebRTC实现低延迟音视频传输,结合人设记忆(Persona Memory)、工具调用(Tools)、RAG检索增强生成,以及可选的数字人视频能力,帮助开发者构建以语音交互为核心的AI Agent。
网站联盟
网站联盟 是一个免费、永久收录各类网站的导航类站点。它的核心价值在于为其他网站提供一个免费的、长期稳定的外部链接,旨在帮助站长增加网站曝光度和搜索引擎权重。

潇楠 · Web3 哨兵
潇楠Web3哨兵是一款桌面端+网页版双端覆盖的专业级Web3监控与交易系统。它的核心定位是:帮你从“被动查链”变成“主动感知链上动态”,同时把发现机会→评估风险→完成交易的闭环全部放在一个软件里完成。
Ant Browser
Ant Browser 是一款面向多账号隔离、代理绑定和本地环境管理的桌面浏览器工具,支持 Windows、Linux 和 macOS(unsigned)三大平台。它的核心目标非常清晰:在一台桌面设备上,帮助用户稳定管理多个彼此隔离的浏览器实例,并配合代理池、浏览器内核和快捷启动能力完成日常运营或测试工作。
NewsCrawler
NewsCrawler 是由 NanmiCoder 开发的一款多平台新闻与内容爬虫集合,支持微信公众号、今日头条、网易新闻、搜狐新闻、腾讯新闻、BBC News、CNN News、Twitter/X、Naver Blog、Detik News、Quora、Lenny‘s Newsletter 等 12 个主流新闻与内容平台。
Any2Text
Any2Text 是一个致力于提供便捷音视频转文字服务的在线AI工具。将您的音频录音、播客、访谈和视频文件转换为准确的文字转录。无需注册,完全免费。

美算AI
一款面向电商场景的 AI 生图与视频生成平台,可帮助商家快速生成商品图、服装图、模特换装图、商品组图以及短视频营销素材。美算AI是面向电商卖家的AI生成工具,支持免费商品套图、服装套图、商品图文转视频和视频复刻。
暂无评论...






