1
Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding
任务设定
设计能在消费级 GPU 上实时运行的机器人操作模型
痛点动机
现有 VLA 模型依赖大语言模型中转,推理慢、显存占用高
解决方案
跳过 LLM 中枢,用轻量双向视觉语言交互直接映射到动作, 32Hz、<1GB 显存下仍高精度
2
Zador Pataki, Paul-Edouard Sarlin, Marc Pollefeys
任务设定
对任意无标定长视频恢复相机标定和度量姿态
痛点动机
SLAM 易受初始化影响失败, SfM 又缺乏鲁棒性
解决方案
融合 SLAM 的时序约束与 SfM 的全局优化,结合稠密匹配与单目深度先验做度量重建
3
Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo
任务设定
评估 VLM 能否通过全身实体执行长时序具身任务
痛点动机
任务失败时难区分是决策错误还是动作执行失误
解决方案
将决策与执行解耦, VLM 只发原子技能指令驱动全身动作,量化模型的具身自我感知能力
4
Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi, Ronghan Chen, Yandan Yang, Tong Lin, Xinyuan Chang, Mu Xu, Bin Liu, De Ma, Zhiheng Ma
任务设定
从无动作标签视频中学习潜在动作辅助机器人策略
痛点动机
确定性潜在动作在递归组合下误差会累积传播
解决方案
用对角高斯分布建模每次转移,靠组合与反转约束均值方差,提升时序一致性
5
Taiye Chen, Qi Zhang, Yisen Wang
任务设定
视频扩散世界模型长程自回归生成易累积误差
痛点动机
误差累积与表征维度坍塌相关,机制此前不明
解决方案
提出视频表征正则化,稳定潜在表征抑制长程误差累积
6
Gabe Everett, Brice Gunter, Ryan Vander Stelt, Cleiver Ruiz-Martinez, Blake Hull, Juan Rojas
任务设定
真实机器人在线强化学习训练耗时长、收敛慢
痛点动机
样本效率低,第一/第三人称视觉数据利用不充分
解决方案
提出 SymmGrid ,用对称群变换并行增广轨迹数据加速训练
7
Jia Luo
任务设定
将人类演示视频转化为机器人可学习数据
痛点动机
人机具身形态差异大,机器人难直接学习人类视频
解决方案
构建任务图并转为机器人规划图指导视频生成,用物理验证器过滤不合理结果
8
Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin
任务设定
让游戏世界模型同时生成画面与内部游戏状态
痛点动机
现有世界模型只求画面真实,常违反游戏机制规则
解决方案
提出 StatePlay ,用混合专家架构联合建模视觉与状态,以状态指导画面生成
9
Yongxin Su, Linjie Hou, Feng Wang, Jialin Tang, Zhijun Li, Qian Wang, Maoqing Yao
任务设定
从单张全景图生成可漫游的室内 3D 场景
痛点动机
现有方法难兼顾轨迹可控性与大范围遮挡处理
解决方案
用轨迹可控的全景视频扩散模型生成视频,再前馈重建为 3D 高斯场景,可作具身智能仿真资产
10
Sami Azirar, Enrico Pallotta, Jan Nogga, Jürgen Gall, Sven Behnke, Hermann Blum
任务设定
构建跨具身的机器人操作视频世界模型
痛点动机
现有视频世界模型难建模操作中的接触约束,动作条件局限特定夹爪
解决方案
以 3D 接触点轨迹 作为通用动作表征,训练跨人类与机器人复用的生成式世界模型
11
Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu, Van-Danh Le, Hoang Huy Le, Dinh Tuan Nguyen, Pham Tuyen Le, Van-Truong Nguyen, Quan Nguyen
任务设定
让人形机器人根据语音指令完成抓取检测
痛点动机
现有抓取检测多依赖文本输入,语音更自然但数据稀缺
解决方案
用轻量 MLP 投影器把文本条件抓取模型迁移到语音,无需级联 ASR
12
Yiming Cai, Fangjie Yu, Meiqing Yu, Ziyue Shi, Pengfei Yuan, Yong Guo
任务设定
构建面向世界模型训练的大规模世界状态数据集
痛点动机
现有视频/机器人数据集只捕捉部分状态,难支撑完整动力学学习
解决方案
从工业 CG 制作流程提取骨骼、动作曲线等多模态状态,含干预/反事实分支,验证 VLA 策略闭环迁移
13
Javier C. Weddington, Bence P. Ölveczky, Stephen A. Baccus
任务设定
低成本四足机器人硬件上的强化学习运动控制
痛点动机
传输延迟和噪声反馈使任务变为部分可观测,拉大 sim-to-real 差距
解决方案
用执行器延迟前向模型配合时间感知网络,学出类中枢模式发生器的鲁棒步态
14
Nazanin Amini, Kevin Desai
任务设定
对角色局部身体部位做动作风格迁移编辑
痛点动机
成对局部编辑数据稀缺,自重建训练易致模型忽略参考动作
解决方案
提出 MoSAIC ,用潜在扩散模型按身体部位路由参考动作,并以对齐干预监督构造反事实目标来训练。
15
Fatemeh Ziaeetabar
任务设定
双手协同动作分割,需处理左右手时间错位问题
痛点动机
现有方法假设双手时间同步,忽略动作转换的可变延迟
解决方案
提出滞后感知跨手对齐模块,估计双手特征间的时序偏移并融合跨手信息
16
Hira Yaseen, Arif Mahmood, Waqas Sultani
任务设定
从单张野外人像估计体重、身高与 BMI
痛点动机
姿态、相机、外观差异大,且缺乏公开数据集
解决方案
融合 RGB、深度、姿态等多模态特征训练单/多任务网络,并发布新数据集