1
Yan Deng, Fei Xu
任务设定
空中视觉语言导航中的动作规划与停止判断
痛点动机
现有 VLA 模型历史记忆有限、规划视野短、终止判断不可靠
解决方案
提出 DreamFly ,用因果对齐记忆增强视觉表征,结合滚动时域扩散规划并直接从动作 logits 估计停止概率
2
Ruochen Li, Shuang Chen, Wenke E, Farshad Arvin, Amir Atapour-Abarghouei
任务设定
单目视频 3D 人体姿态估计
痛点动机
现有方法时空分离建模,弱化时空关联性
解决方案
提出超时空图 Transformer ,局部聚合关节-时间图,双尺度建模长短期依赖
3
Muxin Zhang, Chaohui Yu, Yuanwang Yang, Min Wei, Zhuo Su, Kun Li
任务设定
文本引导生成逼真 3D 人体
痛点动机
现有方法难兼顾几何纹理质量、3D 一致性与效率
解决方案
解耦几何纹理生成,用扩散渲染器多视角显式优化替代慢速 NeRF 隐式优化
4
Lara Pereira, João Ruivo Paulo, Pedro Santos, Paulo Peixoto
任务设定
基于无标记 RGB 视频的自主远程康复系统
痛点动机
无治疗师监督时需自动评估动作质量并预测运动
解决方案
结合双向 LSTM 动作质量分类与图神经网络关节运动预测,生成局部偏差反馈
5
Zhenjie Yang, Xingyu Jiao, Guopeng Zhong, Shuzhe Yang, Shi Che, Chao Wu, Chenyu Jiang, Dongjie Zhang, Yideng Zhang, Zheng Zhang, Muyun Jiang, Haisheng Su, Shuang Jin, Donghang Zhang, Chao Yang, Li Chen, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan
任务设定
面向机器人灵巧手的第一人称人手转机器人图像编辑基准
痛点动机
人手与机器人手外观、关节、视角差异大,阻碍模仿学习数据获取
解决方案
构建 2 亿级编辑数据集,将第一人称人手视频转为灵巧手图像,覆盖 26 种 URDF 构型
6
Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang
任务设定
实时无限时长交互数字人视频生成
痛点动机
传统流式生成依赖顺序蒸馏,长时序易累积误差导致画质下降
解决方案
解耦并行训练:全参数蒸馏保画质,长时程适配器提升长序列鲁棒性,并用分块缓存加速推理
7
Shukrullo Nazirjonov, Sai Prasanna, Anna Manasyan, Georg Martius
任务设定
评估物体中心表征对世界模型规划能力的实际贡献
痛点动机
此前工作未验证物体中心归纳偏置是否真正利于规划与泛化
解决方案
分析槽位质量指标与规划成功率的关系,发现高质量槽位可省去辅助输入并提升分布外鲁棒性
8
Martin Schuck, Maks Sorokin, Simone Manni, Duy Ta, Angela P. Schoellig, Marco Hutter, Simon Le Cleac'H, Jan Brüdigam
任务设定
学习足式机器人运动-操作协同技能
痛点动机
密集奖励设计耗时费力,制约 RL 扩展至复杂任务
解决方案
仿真 SMPC 专家生成海量数据,结合稀疏奖励做离线到在线 RL 训练,性能超越专家
9
Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang
任务设定
姿态驱动的实时流式人体动画生成
痛点动机
扩散模型生成慢,无法满足直播等实时交互需求
解决方案
块因果自回归 DiT 仅需 3 步采样, PR-Sink 缓存机制保证长时外观稳定
10
Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao
任务设定
用单一自回归模型统一机器人推理与动作生成
痛点动机
以往 VLA 中 VLM 只是上下文编码器,推理与动作割裂
解决方案
单一 Transformer 解码器联合输出推理与动作 token ,共享权重实现感知到动作建模
11
Mingwei Xing, Xinliang Wang, Yifeng Shi
任务设定
跨传感器模态的统一 3D 场景理解与语义分割
痛点动机
传统 MoE 路由忽略局部拓扑,语义一致但几何异构时专家难分配
解决方案
提出 STAR 框架,用空间拓扑感知路由与熵控动态专家分配实现跨域泛化
12
Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang
任务设定
机器人操作策略学习中融合世界模型的未来预测能力
痛点动机
显式生成未来视频推理开销大,直接策略又缺少动态上下文
解决方案
提出 ForeWAM,复用视频扩散模型的 KV 状态作为动态先验,无需解码未来视频
13
Jiaru Zhang, Can Cui, Yi Xu, Xin Ye, Ruqi Zhang, Ziran Wang
任务设定
评测驾驶世界模型能否做反事实预测
痛点动机
直接生成替代动作的预测会丢失事实延续,结果看似合理却不真实
解决方案
构建反事实预测基准,并用免训练方法把真实观测注入预测过程提升准确性
14
Ryosei Hara, Masashi Hatano, Rintaro Yanagi, Atsushi Hashimoto, Takuma Yagi, Mariko Isogawa
任务设定
预测手部每个关键点的可见性
痛点动机
遮挡下姿态估计可靠性缺乏显式可见性信号
解决方案
基于预训练 HPE 骨干网络构建可见性检测器,用于可见性加权三角测量降低重投影误差
15
Chushan Zhang, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li
任务设定
世界动作模型依赖迭代视频 rollout 预测未来指导动作
痛点动机
迭代 rollout 推理慢,部署延迟高,但动作可能只需未来的缓存表征
解决方案
提出 RIFT ,用 anticipation tokens 单次前向构建未来 K/V 缓存,免 rollout 大幅降延迟且保持成功率
16
Wenchao Ma, Surya Dwarakanath, Yizhak Ben-Shabat, Dario Kneubühler, Haomiao Jiang, Sharon X. Huang, Hsueh-Ti Derek Liu
任务设定
为神经蒙皮权重生成提供几何先验
痛点动机
数据驱动方法泛化性差,缺乏经典几何法的稳健性
解决方案
提出 cut-cell skinning ,用基于图的方法快速近似体积测地距离,可插入现有神经蒙皮模型
17
Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu
任务设定
构建具身智能体在物理世界执行任务的智能体框架
痛点动机
物理世界缺乏像软件那样读取状态、判断结果的能力
解决方案
用场景图作为持久化世界上下文,以退出码式评估判定动作成败并诊断原因