← 返回项目库

视听融合感知智能引擎|中文本地分析工作台

面向视觉与语音研究者的视听融合感知演示工作台,支持图片上传、听觉线索选择、融合结论查看和本地样本浏览。

本项目基于上游视听融合感知研究代码整理,保留 CogAgent / CogVLM 推理入口,并补充了可直接运行的中文 Streamlit Web 工作台。工作台默认使用仓库内置样本和确定性演示结果,明确披露为本地预览,未接入云端模型或真实音频服务。

真实界面

项目截图

共 6 张

视听融合感知智能引擎
融合分析工作台
本地样本库
运行说明
走廊行走
道路环境

Capabilities

核心功能

中文概览仪表盘
图片上传与本地预览
听觉线索选择
视听融合结论展示
线索贡献度拆解
本地样本库搜索
原始模型 CLI 入口保留

适用场景

多模态感知研究流程演示
视听线索对齐原型验证
基于样本的算法方案沟通

适合谁

计算机视觉、语音交互、多模态研究者,以及需要快速演示视听线索对齐流程的技术团队。

商业化思路

多模态感知原型搭建、研究演示和算法验证咨询;商业使用和再分发需遵守上游许可证及第三方模型权利边界。

你会拿到什么

  • 中文 Streamlit Web 工作台源码
  • 上游 CogAgent / CogVLM CLI 示例
  • 仓库内置演示图片与运行说明
  • 许可证与来源披露

部署流程

  1. 1安装 Python 依赖:pip install -r requirements.txt
  2. 2在仓库目录运行 streamlit run app.py --server.headless true
  3. 3打开本地地址并在融合分析页上传图片、选择听觉线索后提交分析

真实验证结果

已通过 6 个真实运行中文界面、HTTP、可见正文、控制台、坏图和横向溢出质量门。

部署前须知

默认结果为本地确定性演示,不代表真实模型推理;真实推理需要额外模型权重、tokenizer、GPU 和上游依赖配置。

部署难度

中等

最低配置

Python 3.9+;建议 1 vCPU、2 GB 内存用于本地演示。真实 CogAgent / CogVLM 推理需要按上游要求准备模型权重与 GPU。

开源许可证

MIT(以仓库 LICENSE 为准)

最后验证

2026-09-03

技术栈

PythonStreamlitPillowPyTorchTransformers

授权说明

仓库包含 LICENSE 文件,交付包保留上游许可证与来源说明;模型权重、数据集和第三方依赖的权利边界不由本项目扩展。

Release notes

版本记录

1 个已发布版本

vcn-a9805a5a8601 当前推荐

新增中文 Streamlit 工作台、图片上传、本地演示分析、样本库和运行说明页面。

部署要求:Python 3.9+;完整 requirements.txt 包含真实模型推理依赖,演示页面至少需要 Streamlit 与 Pillow。

已知问题:外部模型和真实音频服务未接入,页面结果均明确标注为本地演示。

登录后领取