只需一张照片,就能创建一个能实时视频通话的AI数字人——这不是科幻电影,而是GitHub上已获1300+星标的开源项目CyberVerse。
你是否想过拥有一个属于自己的J.A.R.V.I.S.——能真正看见你、听见你、陪伴你的AI?想再次见到思念之人,听见TA的声音,看见TA对你微笑?CyberVerse让这一切成为可能。
一、CyberVerse是什么?
CyberVerse是一个开源的实时数字人Agent框架,基于WebRTC、人设记忆、工具调用、RAG(检索增强生成)和可选的数字人视频能力,帮助你构建以语音交互为核心的AI Agent。
简单来说,它把大语言模型(LLM)、语音识别(ASR)、语音合成(TTS)、数字人视频生成和WebRTC实时音视频传输全部整合在一起。你上传一张照片,就能生成一个能听、能说、能看见你的AI数字人。
核心定位
CyberVerse不是普通的聊天机器人套壳,而是一个可自托管、可扩展的实时数字人Agent平台。它采用GPL-3.0许可证,主语言为Python,社区活跃度正在快速增长。
二、为什么CyberVerse值得关注?
2.1 一张照片生成实时数字人
这是CyberVerse最引人注目的功能。用户只需提供一张正面照片,系统即可生成实时说话的Talking Avatar。背后技术基于FlashHead 1.3B模型进行面部动画生成,配合LiveAct 18B模型实现更精细的肢体动作和表情控制。
2.2 全双工实时视频通话
用户可以像与真人视频通话一样自然交流,在数字人说话时随时插话、打断,获得全双工的实时互动体验。基于WebRTC的音视频传输,延迟通常在200-500ms范围内。
2.3 多Agent架构:PersonaAgent + SubAgent
CyberVerse采用独特的multi-agent架构:
- PersonaAgent(人格Agent):始终驻守前台,负责与用户保持流畅对话、快速响应打断和上下文切换
- SubAgent(子Agent):后台异步执行搜索、调研、资料整理、总结和HTML报告生成等耗时工作
这种分层设计让复杂任务不会拖慢语音回合,用户可以继续说话、追问或调整方向。
2.4 插件化技术栈
LLM、TTS、ASR、Avatar等核心组件全部采用可插拔设计:
| 组件 | 可选方案 |
|---|---|
| LLM | OpenAI GPT-4o、Claude、通义千问、DeepSeek、本地模型(vLLM/Ollama) |
| TTS | OpenAI TTS、CosyVoice、Fish Speech、ElevenLabs |
| ASR | Whisper(本地/云端)、SenseVoice、Deepgram |
| Avatar | FlashHead 1.3B、LiveAct 18B、百度曦灵、讯飞数字人、Vidu S1 |
三、CyberVerse部署教程(5步上手)
⚠️ 前置提醒:CyberVerse对硬件和环境配置要求较高,更适合开发者、AI产品团队和多模态交互研究者。
环境要求
- Python:3.10+
- Node.js:18+
- Go:1.22+(需要
protoc-gen-go、protoc-gen-go-grpc) - CUDA:12.8+
- PyTorch:2.8+
- FFmpeg + libopus-dev、libopusfile-dev
- GPU(数字人视频模式):至少4GB VRAM,推荐RTX 3060以上
Step 1:克隆项目
git clone https://github.com/Lynpoint/CyberVerse.git cd CyberVerse
Step 2:创建Python环境
conda create -n cyberverse python=3.10 conda activate cyberverse
Step 3:安装依赖
项目依赖包括Python包、Go模块和Node包,具体参照项目根目录的安装脚本。
Step 4:初始化本地配置
# 如果config/不存在,从模板复制 if [ ! -d config ]; then cp -r infra/config config; fi
配置入口说明:
| 文件/目录 | 作用 |
|---|---|
config/env | API Key、服务端点、TURN密码等环境变量 |
config/cyberverse.yaml | 服务端口、pipeline、WebRTC、Avatar开关等主配置 |
config/*_models/ | LLM、Embedding、TTS、ASR等provider定义 |
config/avatar_models/ | 本地Avatar模型参数,每个模型一个YAML文件 |
编辑config/env,填写所需API Key:
vim config/env
常用变量:
OPENAI_API_KEY/OPENAI_BASE_URL:OpenAI或兼容服务DASHSCOPE_API_KEY:阿里云DashScope/Qwen/CosyVoiceDOUBAO_API_KEY:豆包(火山引擎)GEMINI_API_KEY:Gemini LiveBAIDU_XILING_APP_ID/BAIDU_XILING_APP_KEY:百度曦灵数字人XUNFEI_AVATAR_APP_ID/XUNFEI_AVATAR_API_KEY:讯飞数字人
Step 5:配置并启动服务
纯语音模式(无需GPU):将config/cyberverse.yaml中inference.avatar.enabled设为false。
数字人视频模式(需要GPU):
inference:
avatar:
enabled: true
default: "live_act" # 可选 "live_act" 或 "flash_head"
idle_strategy: "silent_inference"
runtime:
cuda_visible_devices: 0 # 多卡可写 0,1
world_size: 1
model_config_dir: "avatar_models"
模型参数写在config/avatar_models/下的独立文件中。
启动三个服务(分三个终端):
- Python推理服务
- Go API服务
- 前端服务
服务启动后,可在Web UI的/settings页面修改API Key和服务端点。
💡 新手建议:先从纯语音模式开始,熟悉后再叠加视频功能。
四、硬件配置参考
| 模型 | 参数量 | 推荐GPU | 数量 | 分辨率 | FPS |
|---|---|---|---|---|---|
| FlashHead | 1.3B | RTX 5090 | 2 | 512×512 | 25+ |
| FlashHead | 1.3B | RTX 5090 | 1 | 464×464 | 20 |
| LiveAct | 18B | RTX PRO 6000 | 2 | 320×480 | 20 |
| LiveAct | 18B | RTX PRO 6000 | 1 | 256×417 | 20 |
如果使用FlashHead Lite档位,单张RTX 4090可达实时(25+ FPS);但Pro档位单张RTX 4090仅约10.8 FPS。
云端方案(无需本地GPU):Vidu S1、百度曦灵数字人、讯飞数字人。
五、实用建议与注意事项
5.1 部署建议
- 硬件先行:跑数字人视频需要NVIDIA RTX 3060以上显卡,纯语音模式则任意Linux服务器即可
- 从简入繁:建议先从纯语音模式开始,熟悉后再叠加视频
- 网络优化:外网访问需配置TURN服务器,内网用STUN即可
- 社区支持:项目有Discord社区,遇到部署问题可直接咨询开发者
5.2 注意事项
- 肖像与伦理红线:数字人技术涉及肖像权、声音权与伦理风险,使用需谨慎
- 非低门槛工具:CyberVerse目前更适合开发者和工程团队,不适合期待“一键安装包”的普通用户
- 部分功能仍在开发中:包括长期记忆跨会话、工具调用与工作流执行、多Agent协作网络等
六、总结
CyberVerse把语音、记忆、RAG、数字人视频整合在一起,而且是完全自托管的开源方案。虽然部署有门槛,但对于追求数据隐私和定制化的开发者来说,这可能是目前最完整的开源数字人Agent框架。
数据统计
数据评估
关于CyberVerse特别声明
本站微企脉提供的CyberVerse都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由微企脉实际控制,在2026年8月28日 下午11:11收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,微企脉不承担任何责任。
相关导航
gemini-web2api是一个开源工具,模拟用户与 Gemini 网页版的交互,将对话接口包装成标准的 REST API,且兼容 OpenAI 的 /v1/chat/completions 格式。这意味着,任何支持自定义 OpenAI API 端点的客户端(如 ChatBox、NextChat、LangChain 等)都可以直接接入。
33台词
33台词是一个专注于通过台词反向查找影片素材的在线工具和移动应用。它的核心功能是帮助用户输入台词关键词,快速定位该台词出现在哪些影片的哪个时间点,主要服务于视频创作者和语言学习者。
Browser Use
Browser Use 是一款开源的 AI 浏览器自动化框架,其核心理念是让 AI Agent 像人类一样使用浏览器。让你用自然语言描述任务,AI 自动操控浏览器完成——打开页面、点击按钮、填写表单、提取数据,全程无需编写一行定位代码。
SnapAny
SnapAny是一个免费的在线及桌面端多媒体下载工具,主打从上千个网站一键保存视频和图片。支持包括YouTube、抖音、Bilibili、TikTok、Facebook、Pinterest等主流国内外平台。
Pinterest Trends
Pinterest Trends是Pinterest官方推出的免费趋势分析工具,旨在帮助用户洞察平台上的热门搜索内容、预测未来流行趋势。该工具特别适合内容创作者、跨境电商卖家及社交媒体运营者使用,通过数据驱动的方式提前布局营销策略。
BlackACE 黑桃A
BlackACE 黑桃A是一个专注于将网站转换为安卓应用程序(Android APP)的在线工具平台。其核心服务可以用官网标题直接概括为:“网站秒变APP”。
wigolo
wigolo(读音类似“威狗罗”)是一个开源的本地优先Web情报工具,专为AI Agent设计。它把搜索、网页抓取、爬虫、信息提取、缓存、深度研究等功能全部封装进一个本地MCP Server中,通过MCP(Model Context Protocol)协议与AI编程助手通信。核心定位:让AI Agent拥有“本地联网大脑”——不需要API Key、不按次数付费、所有数据留在本地机器上。
Wormhole
wormhole专注于普通用户间安全、私密传输大文件的免费工具网站。无需注册,直接通过浏览器端到端加密分享最大10GB的文件,并生成可设置自动过期的链接。
FreeMediaHeckYeah(FMHY)
FMHY(FreeMediaHeckYeah)是一个由社区驱动的、开源且规模庞大的免费资源导航平台。它并不直接存储影视、游戏等文件,而是像一个精心绘制的“互联网资源地图”,系统性地收录并整理了全球范围内高质量、可免费获取的数字资源入口。
TikTok字幕提取器
TikTok字幕提取器是一款完全免费、无需注册的在线工具,致力于帮助用户快速、精准地从TikTok视频中提取字幕文本。
LiveTalking
LiveTalking作为目前GitHub上最活跃的开源实时数字人引擎之一,凭借其低延迟架构(<300ms)、多模型支持(4种渲染方案)、多协议输出(WebRTC/RTMP/虚拟摄像头)和生产级并发能力,已成为个人开发者、中小企业和内容创作者搭建数字人应用的优选方案。
Proxifly's Free Proxy List
Proxifly's Free Proxy List 是一个在 GitHub 上开源的、自动化更新的免费代理列表项目,旨在为开发者、测试人员及普通用户提供可靠、及时且结构化的代理服务器资源。
暂无评论...






