只需一张照片,就能创建一个能实时视频通话的AI数字人——这不是科幻电影,而是GitHub上已获1300+星标的开源项目CyberVerse。
你是否想过拥有一个属于自己的J.A.R.V.I.S.——能真正看见你、听见你、陪伴你的AI?想再次见到思念之人,听见TA的声音,看见TA对你微笑?CyberVerse让这一切成为可能。
一、CyberVerse是什么?
CyberVerse是一个开源的实时数字人Agent框架,基于WebRTC、人设记忆、工具调用、RAG(检索增强生成)和可选的数字人视频能力,帮助你构建以语音交互为核心的AI Agent。
简单来说,它把大语言模型(LLM)、语音识别(ASR)、语音合成(TTS)、数字人视频生成和WebRTC实时音视频传输全部整合在一起。你上传一张照片,就能生成一个能听、能说、能看见你的AI数字人。
核心定位
CyberVerse不是普通的聊天机器人套壳,而是一个可自托管、可扩展的实时数字人Agent平台。它采用GPL-3.0许可证,主语言为Python,社区活跃度正在快速增长。
二、为什么CyberVerse值得关注?
2.1 一张照片生成实时数字人
这是CyberVerse最引人注目的功能。用户只需提供一张正面照片,系统即可生成实时说话的Talking Avatar。背后技术基于FlashHead 1.3B模型进行面部动画生成,配合LiveAct 18B模型实现更精细的肢体动作和表情控制。
2.2 全双工实时视频通话
用户可以像与真人视频通话一样自然交流,在数字人说话时随时插话、打断,获得全双工的实时互动体验。基于WebRTC的音视频传输,延迟通常在200-500ms范围内。
2.3 多Agent架构:PersonaAgent + SubAgent
CyberVerse采用独特的multi-agent架构:
- PersonaAgent(人格Agent):始终驻守前台,负责与用户保持流畅对话、快速响应打断和上下文切换
- SubAgent(子Agent):后台异步执行搜索、调研、资料整理、总结和HTML报告生成等耗时工作
这种分层设计让复杂任务不会拖慢语音回合,用户可以继续说话、追问或调整方向。
2.4 插件化技术栈
LLM、TTS、ASR、Avatar等核心组件全部采用可插拔设计:
| 组件 | 可选方案 |
|---|---|
| LLM | OpenAI GPT-4o、Claude、通义千问、DeepSeek、本地模型(vLLM/Ollama) |
| TTS | OpenAI TTS、CosyVoice、Fish Speech、ElevenLabs |
| ASR | Whisper(本地/云端)、SenseVoice、Deepgram |
| Avatar | FlashHead 1.3B、LiveAct 18B、百度曦灵、讯飞数字人、Vidu S1 |
三、CyberVerse部署教程(5步上手)
⚠️ 前置提醒:CyberVerse对硬件和环境配置要求较高,更适合开发者、AI产品团队和多模态交互研究者。
环境要求
- Python:3.10+
- Node.js:18+
- Go:1.22+(需要
protoc-gen-go、protoc-gen-go-grpc) - CUDA:12.8+
- PyTorch:2.8+
- FFmpeg + libopus-dev、libopusfile-dev
- GPU(数字人视频模式):至少4GB VRAM,推荐RTX 3060以上
Step 1:克隆项目
git clone https://github.com/Lynpoint/CyberVerse.git cd CyberVerse
Step 2:创建Python环境
conda create -n cyberverse python=3.10 conda activate cyberverse
Step 3:安装依赖
项目依赖包括Python包、Go模块和Node包,具体参照项目根目录的安装脚本。
Step 4:初始化本地配置
# 如果config/不存在,从模板复制 if [ ! -d config ]; then cp -r infra/config config; fi
配置入口说明:
| 文件/目录 | 作用 |
|---|---|
config/env | API Key、服务端点、TURN密码等环境变量 |
config/cyberverse.yaml | 服务端口、pipeline、WebRTC、Avatar开关等主配置 |
config/*_models/ | LLM、Embedding、TTS、ASR等provider定义 |
config/avatar_models/ | 本地Avatar模型参数,每个模型一个YAML文件 |
编辑config/env,填写所需API Key:
vim config/env
常用变量:
OPENAI_API_KEY/OPENAI_BASE_URL:OpenAI或兼容服务DASHSCOPE_API_KEY:阿里云DashScope/Qwen/CosyVoiceDOUBAO_API_KEY:豆包(火山引擎)GEMINI_API_KEY:Gemini LiveBAIDU_XILING_APP_ID/BAIDU_XILING_APP_KEY:百度曦灵数字人XUNFEI_AVATAR_APP_ID/XUNFEI_AVATAR_API_KEY:讯飞数字人
Step 5:配置并启动服务
纯语音模式(无需GPU):将config/cyberverse.yaml中inference.avatar.enabled设为false。
数字人视频模式(需要GPU):
inference:
avatar:
enabled: true
default: "live_act" # 可选 "live_act" 或 "flash_head"
idle_strategy: "silent_inference"
runtime:
cuda_visible_devices: 0 # 多卡可写 0,1
world_size: 1
model_config_dir: "avatar_models"
模型参数写在config/avatar_models/下的独立文件中。
启动三个服务(分三个终端):
- Python推理服务
- Go API服务
- 前端服务
服务启动后,可在Web UI的/settings页面修改API Key和服务端点。
💡 新手建议:先从纯语音模式开始,熟悉后再叠加视频功能。
四、硬件配置参考
| 模型 | 参数量 | 推荐GPU | 数量 | 分辨率 | FPS |
|---|---|---|---|---|---|
| FlashHead | 1.3B | RTX 5090 | 2 | 512×512 | 25+ |
| FlashHead | 1.3B | RTX 5090 | 1 | 464×464 | 20 |
| LiveAct | 18B | RTX PRO 6000 | 2 | 320×480 | 20 |
| LiveAct | 18B | RTX PRO 6000 | 1 | 256×417 | 20 |
如果使用FlashHead Lite档位,单张RTX 4090可达实时(25+ FPS);但Pro档位单张RTX 4090仅约10.8 FPS。
云端方案(无需本地GPU):Vidu S1、百度曦灵数字人、讯飞数字人。
五、实用建议与注意事项
5.1 部署建议
- 硬件先行:跑数字人视频需要NVIDIA RTX 3060以上显卡,纯语音模式则任意Linux服务器即可
- 从简入繁:建议先从纯语音模式开始,熟悉后再叠加视频
- 网络优化:外网访问需配置TURN服务器,内网用STUN即可
- 社区支持:项目有Discord社区,遇到部署问题可直接咨询开发者
5.2 注意事项
- 肖像与伦理红线:数字人技术涉及肖像权、声音权与伦理风险,使用需谨慎
- 非低门槛工具:CyberVerse目前更适合开发者和工程团队,不适合期待“一键安装包”的普通用户
- 部分功能仍在开发中:包括长期记忆跨会话、工具调用与工作流执行、多Agent协作网络等
六、总结
CyberVerse把语音、记忆、RAG、数字人视频整合在一起,而且是完全自托管的开源方案。虽然部署有门槛,但对于追求数据隐私和定制化的开发者来说,这可能是目前最完整的开源数字人Agent框架。
数据统计
数据评估
关于CyberVerse特别声明
本站微企脉提供的CyberVerse都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由微企脉实际控制,在2026年8月28日 下午11:11收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,微企脉不承担任何责任。
相关导航
FMHY(FreeMediaHeckYeah)是一个由社区驱动的、开源且规模庞大的免费资源导航平台。它并不直接存储影视、游戏等文件,而是像一个精心绘制的“互联网资源地图”,系统性地收录并整理了全球范围内高质量、可免费获取的数字资源入口。
Raphael AI
Raphael AI 是一个完全免费、无需注册、无限生成的AI图像平台,口号是“全球首个无限免费AI图像生成器”。其核心优势在于场景感知智能路由,系统会根据你的提示,自动在 Z-Image、Flux 2、Qwen-Image、Nano Banana Pro 等先进模型中选择最合适的一个,兼顾质量与速度。
WeWrite
WeWrite 不是传统意义上的“写作软件”,而是一个内容生产 Skill——你可以把它理解为一个装在 AI 助手里的“公众号编辑部”。它的核心理念是:一句话完成正文,后续动作真正独立。WeWrite 把公众号内容创作从“手工作坊”升级到了“流水线”——但你依然是那个把控方向的 editor。它不替你思考,它替你执行。
矩媒 MatrixMedia
矩媒(MatrixMedia)是一款开源的多平台视频矩阵发布与批量分发工具。它的核心价值不在于“AI”,而在于把“发布”这个动作标准化、可编程化,让 AI 工具和自动化脚本能够真正接管这个环节。如果你正在运营自媒体矩阵,或者想构建从内容生成到多平台分发的自动化流水线,MatrixMedia 值得认真尝试——开源、免费、本地运行、数据自主,而且还在持续进化。
小红书运营手册 · AI工作台
《小红书运营手册·AI工作台》是由畅销书《爆款》作者王梦珂(Mengke)及其团队「好事引力」开源的一套免费Codex Skills。它并非一个独立的App或网页工具,而是一组配合《小红书运营手册》使用的高频执行动作集,专为「有好产品、有真实经验、但不知道怎么在小红书讲清楚」的内容创作者和运营者设计。
Wormhole
wormhole专注于普通用户间安全、私密传输大文件的免费工具网站。无需注册,直接通过浏览器端到端加密分享最大10GB的文件,并生成可设置自动过期的链接。
GitHub中文排行榜
GitHub中文排行榜是一个专注于中文项目的 GitHub 榜单 。它通过自动化脚本,定期筛选并排名 GitHub 上包含中文文档或由中文社区主导的热门开源项目 。其核心目标是打破语言壁垒,解决开发者在海量英文项目中难以找到优质中文资源的痛点 。
TOOLFK
TOOLFK在线工具箱是一个为程序员、开发者及普通办公人员提供便捷服务的综合性在线工具集合网站。其核心特点是无需安装、无需注册(大部分工具),直接在浏览器中完成各种任务。
ScriptCat(脚本猫)
ScriptCat,中文名“脚本猫”,是一款开源的浏览器脚本管理器,能够执行用户自定义脚本,让你的浏览器完成更多自动化任务。与传统脚本管理器不同,脚本猫参考了油猴的设计思路,不仅完全兼容油猴脚本,还开辟了一条全新的技术路线——后台脚本运行框架。
SnapAny
SnapAny是一个免费的在线及桌面端多媒体下载工具,主打从上千个网站一键保存视频和图片。支持包括YouTube、抖音、Bilibili、TikTok、Facebook、Pinterest等主流国内外平台。
Prism Browser Community
Prism Browser Community 是一个基于定制 Chromium 的本地指纹浏览器环境管理器,与传统多开浏览器不同,Prism 为每个浏览器环境提供独立的 Cookie、缓存、扩展数据、代理设置和指纹配置,实现多账号隔离管理,且所有数据默认只保存在用户自己的设备上。项目的核心定位是 Local-first(本地优先) ——Community 版本完全免费,且不限制本地环境数量。
Prompt Optimizer
Prompt Optimizer是一个开源的 AI 提示词优化工具,旨在帮助用户编写更高质量的提示词,从而显著提升 AI 模型的输出效果。它通过智能优化、双模式优化(支持系统提示词和用户提示词)以及实时对比测试等核心功能,让提示词的打磨过程变得更加高效和直观。
暂无评论...






