1
Nan Wang, Mohit Yadav, Jonathan Wulff, Aidan Rosenbaum, Kezhou Chen, Yuvan Sharma, Xu Dong, Yiwei Tao
任务设定
面向灵巧操作学习的腱驱动仿人手
痛点动机
欠驱动腱传动难建模、关节难独立控制,学习困难
解决方案
开源仿真模型与驱动映射,配合 RL 训练包实现仿真到实机零样本部署。
2
Haosen Yang, Jifei Song, Zhensong Zhang, Xiatian Zhu, Jiankang Deng
任务设定
将视频生成模型用于深度与法线联合估计
痛点动机
现有生成式方法任务割裂或需大量标注数据联合训练
解决方案
复用预训练视频扩散模型,将几何估计建模为逐帧预测任务,少量数据即可媲美判别式 SOTA
3
Yafei Zhang, Nan Wu
任务设定
面向机器人视频预测的文本引导世界模型
痛点动机
像素级世界模型运动与外观耦合,进展难以量化
解决方案
用语义粒子分解物体运动,结合冻结 CLIP 文本嵌入与因果解码器,仅用外观信息渲染未来帧
4
Victor Besnier, Anh-Quan Cao, Elias Ramzi, Spyros Gidaris, Tuan-Hung Vu, Andrei Bursuc, Eloi Zablocki, Matthieu Cord
任务设定
研究自动驾驶视频扩散模型的规模化规律
痛点动机
驾驶数据稀缺昂贵,需科学分配训练算力预算
解决方案
训练 1M 至 9B 参数模型族,发现训练时长比模型规模更关键, 9B 模型创 nuScenes 新 SOTA
5
Semin Kim, Haechan Shin, Jongyoo Kim
任务设定
单张图片实现全身人体-物体交互三维重建
痛点动机
现有方法缺乏手指级抓握优化,易穿模或悬空
解决方案
分离重建人体、手部与物体,用接触感知优化修正手指抓握姿态
6
Guipeng Xin, Jiahe Xu, Chenhui Wan, Jie Liu, Youmin Hu, Zhongxu Hu
任务设定
工业面板设备的安全约束机器人操作规划
痛点动机
基础模型规划器难以检测与修复安全违规操作
解决方案
用 LTL 与安全有限状态机做双重形式化验证,输出结构化反例定位并修复违规步骤
7
Marin Maletic, Goran Vasiljevic
任务设定
免训练检测可变形无菌纸盒的吸盘抓取点
痛点动机
回收纸盒形变不规则,抓取点难以确定
解决方案
用 VLM 结合 SAM2 定位目标,再依据表面法向做几何评分选取吸盘抓取点,全程免训练。
8
Zhen Xiao, Zhen Shen, Zhaofan Qiu, Ting Yao, Xueliang Liu, Tao Mei
任务设定
参考图像驱动的跨身份角色动画生成
痛点动机
空间映射与动作控制相互纠缠,导致动作还原不准
解决方案
提出 RASA 框架,用 SMPL 姿态先验解耦空间对齐与动作控制,分阶段注入 扩散 Transformer
9
Yongqi Mao, Zijia Dai, Zhishuo Liu, Wei Xu, Kaiwei Wang, Guotao Meng
任务设定
按指定相机轨迹对动态场景视频进行重渲染
痛点动机
点云渲染图与源视频在去噪过程中相互竞争,影响轨迹控制精度
解决方案
把 4D 点云渲染直接注入 流匹配 的初始噪声流形而非作为条件,仅用源视频做视觉条件
10
Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii
任务设定
统一语言与指示手势指令的机器人操作 VLA
痛点动机
同类相似物体间,纯语言难以精确指代目标
解决方案
将三种指令模式统一为文本提示与指示掩码,单一 VLA 兼容处理
11
Zhoupeng Guo, Xinjie Yao, Yunqi Zhu, Zhihe Fan, Siqi Zhao, Jianjun Chen, Yichen Dong, Yan Fan, Pengfei Zhu
任务设定
空地跨视角指代表达行人检测与定位任务
痛点动机
现有方法未联合考虑跨视角身份一致性,难以应对相似行人干扰
解决方案
提出 A-PAIR 基准与 ICRG 框架,结合分解式指代定位与跨视角一致性校准实现空地配对检测
12
Davood Soleymanzadeh, Kaidi Zhang, Zhiyuan Zhang, Bihao Zhang, Xiao Liang, Yu She, Minghui Zheng
任务设定
VLA 模型的机器人操作任务,尤其是精细接触式操作
痛点动机
现有 VLA 仅依赖当前观测,缺少对未来任务动态的推理能力
解决方案
加入轻量级辅助头,训练时让内部表征对齐未来观测提取的潜在动态
13
Anubhav Gupta, Archit Kambhamettu, Vatsal Agarwal, Pulkit Kumar, Abhinav Shrivastava
任务设定
在线将第一人称视频解析为程序性动作步骤
痛点动机
剧烈自运动和遮挡导致在线时序模型过度分割
解决方案
提取手物交互特征,结合任务图束搜索剪枝非法转移,实现免训练在线解析
14
Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia
任务设定
机器人视觉-语言-动作模型的持续预训练
痛点动机
机器人轨迹数据难以规模化,表征质量成为瓶颈
解决方案
多具身动作共监督并保留 VLM 先验,提升跨具身迁移表征质量
15
Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo, Jinshan Ren, Runmao Yao, Ziwei Liu, Mingsheng Long, Yueqi Duan, Jun Gao, Jiangran Lyu, Fangfu Liu, Jialong Wu
任务设定
用可执行代码表示物理世界以支持定量推理
痛点动机
VLM 缺乏物体状态、参数等可推理的显式物理机制
解决方案
智能体通过提出-执行-验证循环构建可执行世界假设,监督训练 VLM
16
Jiarong Han, Jincheng Xiong, Yuzhou Liu, Linzhe Shi, Changjie Wu, Ning Guo, Mu Xu, Hang Zhang, Ming Qian
任务设定
长视频流式 3D 重建与相机位姿估计
痛点动机
长序列下现有流式方法因长程记忆设计而性能退化
解决方案
仅缓存局部 11 帧 KV 特征预测相对位姿,序列组合恢复全局几何
17
Yu Han, Tianwen Qian
任务设定
用世界模型替代真实环境训练 GUI 智能体
痛点动机
强化学习依赖大量真实环境交互,成本高且不稳定
解决方案
世界模型驱动轨迹 rollout,并嵌入推理过程预判动作后果