1
Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu
任务设定
构建家庭场景人体具身多模态数据采集引擎
痛点动机
现有数据集割裂第一视角、动作与手物交互等模态
解决方案
提出双尺度采集引擎 ACE ,同步记录多视角视频、全身与手部动作,构建大规模具身交互数据集
2
Shuyao Shang, Yuqi Wang, Ruopeng Gao, Xu Chen, Tieniu Tan, Lue Fan, Zhaoxiang Zhang
任务设定
构建基于物理语言的世界模型,预测视频演化
痛点动机
现有世界模型直接在像素空间预测,物理规律隐式难解释
解决方案
提出物理语言离散表征,采用先推理后渲染范式,先预测状态转移再生成视频
3
Lizhi Yang, Junheng Li, Aaron D. Ames
任务设定
让人形机器人仅凭视觉躲避飞来的躲避球
痛点动机
真实部署仅有含噪视觉,需保证全身安全避碰
解决方案
提出感知引导的 CBF-RL 框架,仅用头戴相机分割深度训练避险策略, G1 实机成功率 95%
4
Ping-Kun Chiang, Kun-Ru Wu, Po-han Li, Sandeep Chinchali, Ufuk Topcu, Yu-Chee Tseng
任务设定
免训练的多视角 3D 问答(3D-QA)推理框架
痛点动机
现有方法依赖昂贵 3D 标注和微调,扩展性差
解决方案
拆分为视角选择、语言定位、BEV 编码、结构化推理四模块,无需 3D 重建
5
Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu
任务设定
世界模型潜在分布正则化,用于规划任务
痛点动机
现有 EP 目标对尾部样本梯度消失,重尾偏差控制不足
解决方案
用分位数-分位数匹配替代 EP 目标,对齐潜在样本与高斯分位数,保留尾部梯度
6
Jiacheng Zhou, Jinfan Lv, Ruixuan Li, Longtai Zhang, Yan Wang, Wenqiang Zhang, Lizhe Qi
任务设定
面向世界动作模型(WAM)的部署量化方法
痛点动机
现有 PTQ 基于开环假设,不适配 WAM 闭环迭代去噪特性
解决方案
提出联合视频-动作显著性量化与闭环 rollout 校准策略,兼顾精度与部署效率
7
Weiquan Lin, Yu Deng, Shiyang Liu, Luping Xiao, Xu Tang, Junzhi Yu, Jiaolong Yang, Lei Zhang, Xingyu Chen
任务设定
综述基础模型先验在手物交互(HOI)任务中的应用
痛点动机
现有工作笼统称'用大模型',缺乏系统分类和机理分析
解决方案
提出几何/语义/视觉三类八种子先验分类体系,梳理其在 HOI 与机器人学习中的注入方式
8
Jin Cao, Zian Meng, Kaipeng Zhang
任务设定
让 视频世界模型 学会任意动作级控制
痛点动机
结构化动作信号难获取,示范视频动作难以跨场景迁移
解决方案
构造 shadow pairs (动力学相同外观不同的视频对),通过跨影子预测学出统一动作表征
9
Pouya Ardekhani, Zahra Dehghanian, Morteza Abolghasemi, Hamid R. Rabiee
任务设定
仅用单目视频实现开放词汇 3D 场景理解
痛点动机
现有 3D 高斯方法依赖多视角采集、逐场景优化,显存开销大
解决方案
将几何重建与语义解耦,几何独立提取后再用轻量后处理挂载物体级语义嵌入
10
Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang
任务设定
合成可控的第一人称机械臂操作视频以扩充具身数据
痛点动机
真实第一人称操作数据跨场景、物体采集成本高、难以覆盖多样性
解决方案
基于预训练视频生成先验,提出在线锚定投影记忆保场景一致性,配合 Action-3D RoPE 精确编码末端执行器动作
11
Fazhong Liu, Zhuoyan Chen, Haozhen Tan, Yan Meng, Guoxing Chen, Haojin Zhu
任务设定
梳理具身 AI 中世界模型全生命周期的安全威胁与防御
痛点动机
世界模型是决策预测核心,一旦被攻破会传导为错误物理动作
解决方案
构建生命周期威胁分类,覆盖数据投毒到轨迹操纵,并提出对应评估与防御框架
12
Hui Zhang, Julian Ferchow, Jie Song, Mirko Meboldt
任务设定
统一建模抓取、移动、旋转、平移四种灵巧操作技能
痛点动机
现有方法分技能独立建模,难以兼容衔接完成长时序任务
解决方案
用统一状态-动作空间表示四类技能,蒸馏出单一跨技能策略,可泛化新物体并跨手型迁移
13
Hail Song, Seokhwan Yang, Jiwon Yang, Woojin Cho, Woontack Woo
任务设定
从单张图像重建可动画的 3D 高斯头部虚拟形象
痛点动机
单图重建头像在新视角下难保持 3D 一致性
解决方案
用扩散模型生成 3DGS 头像,绑定 FLAME 参数模型实现实时动画驱动
14
MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys
任务设定
单张图像实时驱动的高斯头部虚拟形象生成
痛点动机
现有方法依赖外部追踪流水线,且面部区域特征纠缠
解决方案
提出双轴解耦:计算轴内化驱动省去外部追踪,特征轴拆成三个高斯分支建模不同面部区域
15
Dawei Wang, Di Zhao, Xinyuan Liu, Marci Chi Ma, Xiaoyang Liu, Chengming Zhou, Gary Ushaw, Richard Davison
任务设定
具身多智能体协作中的信用分配问题
痛点动机
反馈稀疏延迟且智能体数量动态变化,分配难度大
解决方案
用多模态大模型对智能体贡献两两比较,转化为排序聚合问题来指导奖励塑形
16
Ziyang Rao, Yiren Zhao, Weiyu Guo, Ben Fei, Yandong Guo, Hui Xiong
任务设定
为具身模型中流匹配动作头估计不确定性
痛点动机
流匹配不确定性不可见,场景误判或 OOD 时易生成错误动作
解决方案
提出 denoising acceleration 代理指标,单次前向即可衡量去噪轨迹弯曲程度,免训练免重采样
17
Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan
任务设定
构建连续时间世界模型以预测未来状态
痛点动机
现有世界模型局限于离散时间预测,难以捕捉物理连续动态
解决方案
提出 Physical-Time Flow ,用 ODE 建模潜空间速度场,支持任意时间分辨率预测甚至反向预测
18
Sihyung Yoon, Minjong Yoo, Sanghyun Ahn, Seojeong Choi, Honguk Woo
任务设定
把预训练 VLA 模型转化为鲁棒机器人智能体
痛点动机
VLA 缺乏失败恢复机制,长时程执行不稳定
解决方案
提出模块化框架 RoboBRIDGE ,含监控、规划、控制模块,用 LoRA 适配器微调技能应对跨平台迁移
19
Dragos Costea, Alina Marcu, Cristina Lazar, Marius Leordeanu
任务设定
远距离无人机视角下识别人体意图与体态语言
痛点动机
缺乏无人机视角人体动作意图数据来训练模型
解决方案
构建无人机人体意图数据集,用几何世界模型把带意图的 3D 虚拟人精准嵌入无人机 4K 视频
20
Zhengyang Yan, Junhao Li, Fangqi Zhu, Zijun Wang, Quanxin Shou, Yikun Miao, Xiaoyi Pang, Zicong Hong, Song Guo
任务设定
用离线强化学习改进机器人操作的流匹配 VLA 策略
痛点动机
部署时分布偏移导致误差累积,失败数据未被有效利用
解决方案
提出 RedFlow ,检索相似场景的成功动作作为纠正目标,用自适应重定向目标联合强化成功、抑制失败动作
21
Jaehun Jung, Wonjun Kim
任务设定
仅凭头部姿态重建全身人体网格
痛点动机
头显设备只有头部轨迹,扩散模型推理又慢
解决方案
用引导变分自编码器对齐潜在分布,单步采样替代扩散过程,提速 50 倍以上
22
Renlong Wu, Haoran Chen, Yuxiang Wei, Xiaowei Jin, Wangmeng Zuo, Hui Li
任务设定
根据文本直接生成 360 度环绕的动态人体 4D 资产
痛点动机
先生成视频再拟合 4D 表示成本高,且几何常不完整、视角不一致
解决方案
提出扩散框架端到端生成 4D Gaussian Splatting ,用 3D U-Net 加时序注意力建模运动,无需先生成视频
23
Jiajia Lin, Mingxuan Du, Tuowen Zhou, Benfeng Xu, Hongtao Xie
任务设定
评测 多人交互图像编辑 的解剖合理性
痛点动机
编辑易现肢体粘连穿模, VLM 评测反而测不出
解决方案
基于 多人网格重建,用穿透与表面距离量化接触真实性
24
Xiangcheng Zhang, Yilun Du
任务设定
基于 世界模型 的机器人通用决策规划
痛点动机
模仿学习策略难以泛化到新场景与新任务
解决方案
结合 VLM 推理与位姿-图像条件世界模型,想象式推演迭代优化动作计划
25
Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh
任务设定
研究 VLA 模型的跨具身迁移能力
痛点动机
跨机器人形态的模仿学习数据难以有效迁移复用
解决方案
用物体框、末端执行器轨迹等行为对齐表征统一跨具身数据,提升 VLA 迁移效果