← 返回项目库

VibeVoice 实时语音合成中文演示

可本地运行的 VibeVoice 实时语音合成中文界面与演示项目。

这是一个基于 FastAPI、WebSocket 和 VibeVoice Realtime 模型的本地语音合成演示。界面已完成中文化,保留说话人、CFG、推理步数、流式输入和音频保存等真实交互;模型从 Hugging Face 下载,适合研究、学习与内部原型验证。

真实界面

项目截图

共 6 张

状态:默认设置
状态:已填写文本
状态:已选择英语说话人
状态:已选择日语说话人
状态:控件已重置
状态:已选择法语说话人

Capabilities

核心功能

中文化实时语音合成网页界面
25 个预置说话人可选
支持流式文本输入与 WebSocket 输出
CFG Scale 与推理步数控件
运行指标、日志和状态反馈
生成音频保存入口

适用场景

本地研究开源实时 TTS 模型
验证中文语音交互产品原型
学习 FastAPI、WebSocket 与模型服务集成

适合谁

需要自托管语音合成演示、研究开源 TTS 模型或进行语音产品原型验证的开发者与团队。

商业化思路

研究与二次开发交付;使用者自行准备模型、算力和部署环境,并依据上游许可证承担使用责任。

你会拿到什么

  • 固定提交版本完整源码包
  • 中文化真实运行界面截图、许可证和部署说明

部署流程

  1. 1创建 Python 3.12 虚拟环境并执行 pip install -e ".[tts]"。
  2. 2首次启动时下载 VibeVoice Realtime 模型及语音预设。
  3. 3执行 PYTHONPATH=demo python demo/vibevoice_realtime_demo.py --port 3000 --device cpu。
  4. 4浏览器打开本机端口,填写文本、选择说话人并点击开始。

真实验证结果

已通过 6 个真实运行中文界面、HTTP、可见正文、控制台、坏图和横向溢出质量门。

部署前须知

首次启动需要下载约 2 GB 模型;CPU 推理可能较慢。上游仓库的研究用途提示、模型权重和语音预设权利边界需要使用者自行核验。

部署难度

中等

最低配置

Python 3.12、约 2 GB 模型下载空间、建议 8 GB 内存;CPU 可运行但推理速度取决于机器性能,GPU 或 Apple Silicon 可进一步改善体验。

开源许可证

MIT License

最后验证

2026-09-03

技术栈

PythonFastAPIUvicornPyTorchTransformersWebSocket

授权说明

交付包原样保留上游 MIT License 与版权声明;上游项目明确面向研究与开发用途,商业或真实生产使用前需自行核验模型、语音预设及相关权利。

Release notes

版本记录

1 个已发布版本

vcn-ef4b3edf069d 当前推荐

恢复候选 718 的固定源码并完成中文实时语音合成界面、真实启动和 6 个状态截图验收。

部署要求:Python 3.12、可写模型缓存目录和建议 8 GB 内存;首次运行需要可访问 Hugging Face,CPU 或 GPU 由启动参数选择。

已知问题:模型下载、CPU 推理时延和上游研究用途限制不在源码包内解决;音频生成性能需由部署环境实测。

登录后领取