← 返回项目库

HMA 机器人视频动态中文版|语言桌面交互演示

面向机器人视频动态研究的中文 HMA 交互演示,支持加载语言桌面场景并用方向动作观察模型预测画面。

项目实现异构掩码自回归机器人视频动态模型,提供本地 Gradio 界面、语言桌面提示图和四向动作推理,适合研究复现、模型推理验证与源码学习。

真实界面

项目截图

共 6 张

当前场景:frame_00.png;最近动作:已加载;预测步数:0
当前场景:frame_00.png;最近动作:向上;预测步数:1
当前场景:frame_00.png;最近动作:向下;预测步数:1
当前场景:frame_00.png;最近动作:向左;预测步数:1
当前场景:frame_00.png;最近动作:向右;预测步数:1
当前场景:frame_00.png;最近动作:向右;预测步数:2

Capabilities

核心功能

HMA 机器人视频动态模型推理
语言桌面场景提示图选择
加载初始场景并初始化模型状态
向上、向下、向左、向右动作预测
Gradio 本地交互式演示界面
PyTorch CUDA、MPS 与 CPU 设备适配
训练、生成与评估脚本源码

适用场景

研究机器人视频动态和世界模型方法
本地演示语言桌面动作到下一帧预测
学习 HMA、MAR、扩散损失和 PyTorch 推理代码

适合谁

机器人学习、视频生成和世界模型研究者,以及需要本地演示 HMA 推理流程的开发者。

商业化思路

开源研究源码交付与本地部署;使用者自行准备模型缓存、算力和数据集,并依据上游许可证使用。

你会拿到什么

  • HMA 模型、仿真入口和 Gradio 演示源码
  • Apache 2.0 许可证、中文运行说明和兼容性修改
  • 不含下载后模型权重的可审计源码包

部署流程

  1. 1安装 Python 3.10 及以上并按 requirements.txt 安装依赖
  2. 2准备源码声明的 HMA 语言桌面检查点和 Stable Video Diffusion 编码器缓存
  3. 3在源码目录运行 python -m sim.app 并按页面提示加载场景
  4. 4根据设备设置 HMADEVICE=cuda、mps 或 cpu,生产部署前自行配置服务进程

真实验证结果

已通过 6 个真实运行中文界面、HTTP、可见正文、控制台、坏图和横向溢出质量门。

部署前须知

模型权重不随源码包交付,首次运行需要下载并缓存;CPU 推理很慢,训练与评估脚本仍更适合 CUDA 环境;研究模型效果和第三方模型条款需由使用者自行评估。

部署难度

较高

最低配置

Python 3.10 及以上,建议具备可用 CUDA 或 Apple Silicon MPS;完整模型运行需预留至少 8 GB 内存和足够磁盘空间。

开源许可证

Apache License 2.0

最后验证

2026-08-28

技术栈

PythonPyTorchGradioTransformersDiffusersOpenCV

授权说明

交付包保留上游 LICENSE、版权信息和来源说明;本次交付包含中文界面、依赖版本、设备兼容性和运行安全默认值修改。

Release notes

版本记录

1 个已发布版本

vcn-b26b8b3037dd 当前推荐

完成 Gradio 界面中文化,统一模型检查点路径,修复依赖声明、外部分享默认值和 Apple Silicon 设备兼容性,并完成真实 MPS 加载与多动作证据复核。

部署要求:Python 3.10 及以上;按 requirements.txt 安装 PyTorch、Gradio、Diffusers、Transformers、OpenCV 等依赖,并准备模型检查点和编码器缓存。

已知问题:源码包不含下载后的模型权重;CPU 模式耗时较长,MPS 或 CUDA 设备需满足本地 PyTorch 支持条件;未执行生产托管配置。

登录后领取