新增中文 Streamlit 工作台、图片上传、本地演示分析、样本库和运行说明页面。
部署要求:Python 3.9+;完整 requirements.txt 包含真实模型推理依赖,演示页面至少需要 Streamlit 与 Pillow。
已知问题:外部模型和真实音频服务未接入,页面结果均明确标注为本地演示。
面向视觉与语音研究者的视听融合感知演示工作台,支持图片上传、听觉线索选择、融合结论查看和本地样本浏览。
本项目基于上游视听融合感知研究代码整理,保留 CogAgent / CogVLM 推理入口,并补充了可直接运行的中文 Streamlit Web 工作台。工作台默认使用仓库内置样本和确定性演示结果,明确披露为本地预览,未接入云端模型或真实音频服务。
真实界面
共 6 张
Capabilities
计算机视觉、语音交互、多模态研究者,以及需要快速演示视听线索对齐流程的技术团队。
多模态感知原型搭建、研究演示和算法验证咨询;商业使用和再分发需遵守上游许可证及第三方模型权利边界。
已通过 6 个真实运行中文界面、HTTP、可见正文、控制台、坏图和横向溢出质量门。
默认结果为本地确定性演示,不代表真实模型推理;真实推理需要额外模型权重、tokenizer、GPU 和上游依赖配置。
部署难度
中等
最低配置
Python 3.9+;建议 1 vCPU、2 GB 内存用于本地演示。真实 CogAgent / CogVLM 推理需要按上游要求准备模型权重与 GPU。
开源许可证
MIT(以仓库 LICENSE 为准)
最后验证
2026-09-03
技术栈
授权说明
仓库包含 LICENSE 文件,交付包保留上游许可证与来源说明;模型权重、数据集和第三方依赖的权利边界不由本项目扩展。
Release notes
1 个已发布版本
新增中文 Streamlit 工作台、图片上传、本地演示分析、样本库和运行说明页面。
部署要求:Python 3.9+;完整 requirements.txt 包含真实模型推理依赖,演示页面至少需要 Streamlit 与 Pillow。
已知问题:外部模型和真实音频服务未接入,页面结果均明确标注为本地演示。