1
Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu
任务设定
机器人零样本跨任务操作泛化
痛点动机
新任务需重新训练,语言指令难传达丰富视觉线索
解决方案
提出 Zero-WAM 因果视频-动作模型,以人类视频为上下文提示引导机器人完成新任务
2
Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao
任务设定
为单帧 VLA 模型增加时序建模能力
痛点动机
单帧范式无法保留历史观测,空间感知不精确
解决方案
提出 StreamPI 流式框架,用指令锚定时序单元实现跨帧因果建模,不增加新参数
3
Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei, Zackory Erickson, Aviral Kumar
任务设定
训练 VLM 用自然语言推理指导机器人操作
痛点动机
长时序操作需追踪进度、纠错,纯模仿学习难以泛化
解决方案
提出 R³方法,先用专家推理轨迹中期训练,再用规则强化学习优化推理指导动作
4
Yueen Ma, Zenglin Xu, Irwin King
任务设定
构建以物体为中心的 4D 高斯溅射世界动作模型
痛点动机
2D 世界模型缺乏空间结构,重复处理冗余静态背景
解决方案
分离动态物体与静态背景,用策略模型预测动作,世界模型预测其高斯点变换,背景直接复用历史观测
5
Yiwen Chen, Guosheng Lin, Chi Zhang
任务设定
分离世界演化逻辑与视觉渲染的世界模型框架
痛点动机
视频模型只学视觉表象,难维持长期规则一致演化
解决方案
编码智能体作为世界大脑生成代码维护状态,转换为代理视频驱动视频模型渲染画面
6
Pouya P. Niaz, Justus Piater, Alejandro Agostini
任务设定
面向接触丰富任务的机器人任务与运动规划
痛点动机
传统 TAMP 用简化物体模型,难处理真实物理接触约束
解决方案
用 VLM 生成物体间可供性约束(抓取/支撑),融入 U-TAMP 提升异质物体操作成功率
7
Xiang Liu, Sen Cui, Changshui Zhang
任务设定
对具身智能的动作条件世界模型做后训练优化
痛点动机
模型误差集中于机械臂、物体等局部时空区域,训练效率低
解决方案
引入轻量置信度探针预测密集置信度图,指导数据筛选与局部加权训练
8
Huayang Chen, Longhui Qin
任务设定
面向人形机器人的灵巧五指手设计与精细操作
痛点动机
复杂操作依赖手的灵巧性与触觉感知能力,二者常难以兼顾
解决方案
采用腱驱动软硬混合结构,指端分布双模态触觉传感器实现抓取与力感知
9
Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan, Kaipeng Zhang, Wangbo Zhao, Yang You
任务设定
用游戏开发流程为世界模型提供可验证训练数据
痛点动机
现有空间生成依赖 CLIP 分数等模糊代理奖励,难支撑 RL 训练
解决方案
提出 RLHEV,结合游戏引擎密集验证信号与人类开发反馈做 RL 后训练
10
Lewis de Zoete Grundy, Chris McCarthy, Christopher Fluke
任务设定
人机协作中低延迟的人体动作早期预测
痛点动机
骨架表示细粒度不足,密集光流计算量大难满足实时性
解决方案
提出姿态锚定光流 PoseOFF,在关节局部提取运动特征辅助早期意图理解
11
Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu
任务设定
视频生成中相机与物体运动的统一 4D 在线控制
痛点动机
现有方法只能分别控制相机或 2D 轨迹,缺乏 3D 一致的实时流式生成
解决方案
用统一的 3D 点轨迹表示编码运动,蒸馏为可流式生成的因果模型
12
Yehao Lu, Jiarui Yang, Yuning Su, Yufeng Xie, Yu Zhong, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Zequn Qin, Enyu Li, Xi Li
任务设定
VLA 模型中动作专家缺失细粒度视觉信息
痛点动机
动作专家难获取 VLM 中的 3D 几何与 2D 语义特征,限制精细操作
解决方案
提出 V-Link ,学习空间/语义查询并通过非对称路径注入 Action DiT 增强感知定位
13
Aoi Otake, Ferdinand Hartmann, Ko Igari, Shingo Murata
任务设定
物理人机协作中自适应调整机器人关节刚度
痛点动机
人类意图不明确时需柔顺配合,意图清晰时需提供有力辅助
解决方案
用生成式动作块采样预测多种未来动作,采样方差大小实时调节刚度与阻尼
14
Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn
任务设定
让 VLA 模型 具备精细的 3D 空间推理能力用于机器人操作
痛点动机
2D patch token 缺乏几何结构,深度图也难以表达空间信息
解决方案
提出 GaussVLA ,将语义与深度特征提升为 3D 高斯 token ,并结合深度感知思维链推理
15
Wentao Jiang, Youchen Xie, Haidi Fan, Yajing Chen, Xin Wang, Ye Shi, Jingya Wang
任务设定
数字人的在线协语手势生成,实时交互场景
痛点动机
现有方法依赖离线完整语音,无法满足低延迟实时交互需求
解决方案
用因果自回归模型仅凭历史语音流式预测动作,并引入自进化训练闭环