1
Chuhao Chen, Peter Wonka, Chaoyang Wang, Chen Wang, Qiao Feng, Sergey Tulyakov, Lingjie Liu
任务设定
图到视频生成中实现细粒度物理运动控制
痛点动机
现有方法要么需预设完整控制序列,要么仅操控像素位置
解决方案
用自回归模型结合结构化场景记忆和稀疏速度信号,学习真实物理动态
2
Gjergj Plepi, Sven Behnke
任务设定
面向视频生成与机器人任务的物体级隐空间表示
痛点动机
现有 VAE 隐空间缺乏语义结构,影响生成质量和下游效果
解决方案
提出 SlotDiT ,用物体级 slot 隐空间替代 VAE ,自回归预测物体轨迹生成视频
3
Shizhang Fanga, Wanling Yea, Qi Zheng
任务设定
研究 2D 图像编码器对室内语义占用预测的影响
痛点动机
现有 embodied 场景理解流程常忽视图像骨干网络选择
解决方案
固定 3D 融合结构,仅替换 2D backbone (如 DINOv2 ),发现其对精度影响远超架构改进
4
Yinhao Li, Weixin Mao, Zihan Lan, Jikun Rong, Qirui Hu, Yiming Zhang, Weipeng Deng, Bowen Shen, Minzhao Zhu, Yiming Mao, Yan Yang, Chenguang Cui, Hongyuan Chen, Xu Huang, Zheyi Zhao, Pinxi Shen, Bozhen He, Zhen Fu, Yifan Wang, Zexin Zhang, Ang Gao, Haoyu Chen, Chengqi Shi, Hua Chen
任务设定
为 VLA/世界动作模型打造一站式具身智能工程平台
痛点动机
算法落地受限于数据、训练、部署接口碎片化
解决方案
统一数据与模型接口,结合实时分块推理与人机协同修正闭环
5
Ryosei Hara, Wataru Ikeda, Masashi Hatano, Mariko Isogawa
任务设定
基于事件相机的第一人称 3D 手部网格重建
痛点动机
佩戴者运动带来密集背景事件,左右手区分困难
解决方案
引入实例级手部检测器与自适应注意力建模双手交互
6
Yifan Xie, Hekun Tian, Jinkun Liu, YuAn Wang, Qiao Sun, Wenbo Ding
任务设定
从无标注人类视频中学习几何潜在动作表示
痛点动机
视觉重建易将动作与外观、相机运动混淆
解决方案
用 4D 几何教师监督潜在动作,再驱动世界-动作模型完成机器人操作
7
Gopi Krishna Erabati, Bjarne Johannsen, Angus Stewart, Vardeep Singh Sandhu
任务设定
面向自主装载机的视觉-语言-动作控制
痛点动机
需联合推理任务语义、视觉与 3D 场景几何
解决方案
VLM 提供语义上下文,BEV 几何直接接入动作专家做流匹配控制
8
Zhenyang Feng, Jimin Heo, Erik B. Sudderth, Unnat Jain
任务设定
为动态机器人操作任务增强 VLA 模型的时序理解
痛点动机
单帧观测导致运动模糊和状态混淆,动态任务易失败
解决方案
引入冻结视频模型提取的运动摘要和本体感觉历史,无需改动骨干网络
9
Hojin Lee, Sizhe Lester Li, Maximilian Hilger, Susie Lu, Achim J. Lilienthal, Vincent Sitzmann, Daniel A. Duecker
任务设定
用视频生成模型做机器人长时程导航规划
痛点动机
长时程规划和视频到动作的精确转换仍待解决
解决方案
用 BEV 地图和自车视角作视觉线索引导视频规划,再用逆动力学模型把光流转成动作
10
Nanjie Yao, Hao Wang, Chong Cheng, Zhikang Chen, Wenzhe Li, Jiafei Lyu, Li Shen, Peilin Zhao, Zongqing Lu, Gao Huang, Steven Hoi, Dacheng Tao, Deheng Ye
任务设定
综述具身智能中世界模型的能力层级
痛点动机
现有综述未厘清哪些预测能力真正提升行为决策
解决方案
提出可信/可控/可行动三级框架,用 3x4 矩阵分析几何物理与动作对齐
11
Jiangong Xiao, Zhihao Zhang, Yifei Dong, Chao Ma, Zhouyi Jin, Zhiwen Hou, Li Liu, Weihuang Chen, Hongbin Sun, Maoqing Yao
任务设定
从野外头戴相机视频重建度量级双手与头部 4D 运动
痛点动机
现有度量级手部数据依赖工作室装备,难以扩展到真实场景
解决方案
基于双目立体标定获取真实尺度,离线重建统一坐标系下的手部与头部轨迹并经动捕验证
12
Liu Cao, Xingze Wu, Jingzhi Cui, Botian Xu, Mingzhi Pei, Ruoqu Chen, Mengdi Xu
任务设定
学习人形机器人全身灵巧的人-物交互操控
痛点动机
人类演示到机器人的接触迁移因体型与动力学差异而困难
解决方案
通过接触感知重定向将人类演示转为机器人动作,用接触与几何感知策略联合控制全身与灵巧手
13
Yang Zhao, Zhuo Chen, Xubo Yang
任务设定
评测 VLM 在第一视角下的路径点导航决策能力
痛点动机
现有空间智能基准仅测孤立判断,缺乏综合导航评测
解决方案
构建 EgoPathBench 基准,用带标注路径点的第一视角图像评测导航能力
14
Yushan Bai, Boyu Zheng, Zhiyang Mao, Hongzheng Sun, Yuchuang Tong, En Li, Zhengtao Zhang
任务设定
灵巧手多指操作中建模手物交互的接近状态
痛点动机
视觉遮挡、触觉标定负担使接触状态难以稳定感知
解决方案
提出 ProxiDex ,用接近点云表征交互,学习动作条件化的接近动力学来指导策略
15
Ziyu Chen, Henghui Bao, Haoran Chang, Alan Yu, Ran Choi, Kai McClennen, Gio Huh, Kevin Yang, Ri-Zhao Qiu, Yajvan Ravan, John J. Leonard, Xiaolong Wang, Phillip Isola, Ge Yang, Yue Wang
任务设定
评测视觉运动控制器在真实场景中的表现
痛点动机
真实世界部署测试代价高,仿真与现实存在训练评测差距
解决方案
用 3D 高斯泼溅重建 60 余个城市室内外场景,搭建逼真闭环仿真基准
16
Hui Zhang, Mirko Meboldt, Jie Song
任务设定
可控约束条件下的灵巧抓取动作合成
痛点动机
已有方法难以按任务约束(方向/接触/轨迹)精细控制抓取
解决方案
提出分层约束表示与掩码残差接口,动态腕部引导实现精确可控抓取
17
Saswat Subhajyoti Mallick, Riu Cherdchusakulchai, Marc Ruiz Olle, Albert Mosella-Montoro, Jose Ribeiro-Gomes, Francisco Vicente Carrasco, Fernando De la Torre
任务设定
稀疏外部相机下快速运动物体的流式 4D 重建
痛点动机
现有流式 4D 重建仅限室内慢速场景,室外高速场景无解决方案
解决方案
融合稀疏匹配、光流与 4D 高斯泼溅,卡尔曼式时序更新提升精度效率
18
Anubhav Khanal, Prabigya Acharya, Roshni Poudel, Sujan Kapali, Bigyan Bhatta, Pramish Paudel, Francois Rameau, Danda Pani Paudel
任务设定
面向 3D 场景的视觉语言理解分层基准测试
痛点动机
现有 3D 数据集丢失纹理等视觉细节且缺乏层级化标注与多步推理评测
解决方案
构建 966 个高斯泼溅重建场景,标注层级语义并设计多步空间推理任务
19
Zuxing Lu, Hongjia Zhai, Guanzhi Wang, Huajian Zeng, Jiaqi Yang, Jingyu Liu, Lei Cheng, Yuantai Zhang, Yuheng Qiu, Zezhou Cheng, Ivan Laptev, Danfei Xu, Benjamin Riviere, Giuseppe Loianno, Eric Xing, Xingxing Zuo
任务设定
综述机器人学习中的世界-动作模型( WAM )
痛点动机
未来预测与动作生成常割裂,缺乏统一梳理
解决方案
提出统一分类法梳理表征、转移建模、动作接口,总结数据集、基准与挑战
20
Harsh Kumar Agarwal, Xavier Alameda-Pineda, Olivier Perrotin
任务设定
根据语音和情绪标签生成全身动作与表情
痛点动机
强条件信号被弱化,导致动作对情绪不敏感
解决方案
用 双路扩散模型 分别生成 SMPL-X 体态和 FLAME 表情,并用情绪分类器强化区分度
21
Teng Liu, Yinfeng Yu
任务设定
机器人依据视觉和双耳音频进行声源导航
痛点动机
现有多模态融合难以捕捉几何语义关系,导致信息退化
解决方案
用 循环一致性跨注意力 强化视听语义对齐,结合 时序记忆模块 融合历史信息
22
Ziheng Yang, Yinfeng Yu, Yongming Li
任务设定
音频驱动的 3D 说话人头部生成
痛点动机
语音特征缺乏显式面部结构信息,导致嘴部动作不准确
解决方案
用 面部关键点 引导 3D 高斯 分布增强表情敏感区域,并做全局关键点补偿
23
Shaohang Wu, Yinfeng Yu
任务设定
依据声源进行视听导航中的动态路径规划
痛点动机
视觉感知不完整时缺乏自适应重规划能力,导致导航低效不安全
解决方案
用 Transformer 融合多模态线索,结合 动态图规划 实时避障重规划