恢复候选 718 的固定源码并完成中文实时语音合成界面、真实启动和 6 个状态截图验收。
部署要求:Python 3.12、可写模型缓存目录和建议 8 GB 内存;首次运行需要可访问 Hugging Face,CPU 或 GPU 由启动参数选择。
已知问题:模型下载、CPU 推理时延和上游研究用途限制不在源码包内解决;音频生成性能需由部署环境实测。
可本地运行的 VibeVoice 实时语音合成中文界面与演示项目。
这是一个基于 FastAPI、WebSocket 和 VibeVoice Realtime 模型的本地语音合成演示。界面已完成中文化,保留说话人、CFG、推理步数、流式输入和音频保存等真实交互;模型从 Hugging Face 下载,适合研究、学习与内部原型验证。
真实界面
共 6 张
Capabilities
需要自托管语音合成演示、研究开源 TTS 模型或进行语音产品原型验证的开发者与团队。
研究与二次开发交付;使用者自行准备模型、算力和部署环境,并依据上游许可证承担使用责任。
已通过 6 个真实运行中文界面、HTTP、可见正文、控制台、坏图和横向溢出质量门。
首次启动需要下载约 2 GB 模型;CPU 推理可能较慢。上游仓库的研究用途提示、模型权重和语音预设权利边界需要使用者自行核验。
部署难度
中等
最低配置
Python 3.12、约 2 GB 模型下载空间、建议 8 GB 内存;CPU 可运行但推理速度取决于机器性能,GPU 或 Apple Silicon 可进一步改善体验。
开源许可证
MIT License
最后验证
2026-09-03
技术栈
授权说明
交付包原样保留上游 MIT License 与版权声明;上游项目明确面向研究与开发用途,商业或真实生产使用前需自行核验模型、语音预设及相关权利。
Release notes
1 个已发布版本
恢复候选 718 的固定源码并完成中文实时语音合成界面、真实启动和 6 个状态截图验收。
部署要求:Python 3.12、可写模型缓存目录和建议 8 GB 内存;首次运行需要可访问 Hugging Face,CPU 或 GPU 由启动参数选择。
已知问题:模型下载、CPU 推理时延和上游研究用途限制不在源码包内解决;音频生成性能需由部署环境实测。