Junyi Hu, Shuaihang Yuan, Geeta Chandra Raju Bethala, Anthony Tzes, Yi Fang
任务设定
视觉导航中为扩散规划轨迹自适应选安全边界
痛点动机
固定安全边界会导致绕路超时或冒险抄近道
解决方案
用情境安全评价器给候选轨迹打分排序,蒸馏为纯感知选择器,可迁移到 Unitree G1 人形机器人
Peiran Xu, Jiaqi Zheng, Ziyou Wang, Yadong Mu
任务设定
统一多种仿真器评测具身任务规划
痛点动机
各仿真器观测/动作格式不同,难以统一训练评估
解决方案
提出 UniETP 统一接口整合 AI2-THOR 等 4 个仿真器,标准化观测动作空间并自动生成多样任务数据
Lingfeng Zhang, Zhanguang Zhang, Liheng Ma, Tongtong Cao, Yingxue Zhang
任务设定
视觉语言导航中利用未来观测辅助决策
痛点动机
传统模仿学习只监督下一步动作,忽略未来视觉预测
解决方案
提出 FSC-VLN,训练时用未来视觉隐向量监督当前状态,推理时无需真实未来图像
Letian Cheng, Qi Zhang, Yisen Wang
任务设定
世界模型长时程规划中的候选动作生成问题
痛点动机
规划步长增加时,固定候选预算难以覆盖指数级动作空间
解决方案
提出子目标条件化动作生成器,先预测潜在子目标再据此生成候选动作序列,由世界模型评估筛选
Lingyu Kong, Ruicheng Li, Ruicheng Wang, Sicheng Xu, Chengtang Yao, Jianfeng Xiang, Jiaolong Yang
任务设定
单目几何估计中细节结构(如细长物体)失真问题
痛点动机
2D 参数化解码导致深度不连续处特征混合,细节过平滑
解决方案
提出稀疏体素细化(SSR),将粗点图提升到 3D 稀疏体素壳上按空间邻近性精细化
Yongyan Wen, Feifan Liu, Jinyi Chen, Bo An, Peng Liu, Siyuan Li
任务设定
长时程机器人操作中的高层技能选择决策
痛点动机
现有方法把技能选择当黑盒映射,难以监督和干预
解决方案
构建可解释的概念空间,用决策树预测技能,支持逐概念人工修正
Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao
任务设定
让具身智能体依据语言指令预测导航动作
痛点动机
视觉语言对齐、动作空间适配与训练稳定性难以兼顾
解决方案
两阶段训练:Q-Former 做视觉语言对齐,再用 LoRA 微调专家导航轨迹
Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang
任务设定
从单目第一人称视频重建 4D 人体与场景
痛点动机
现有方法依赖预计算轨迹,割裂建模人体与场景且推理慢
解决方案
掩码生成式 Transformer 单前向统一建模 RGB、轨迹、姿态、手部与深度
Tuan Duong Trinh, Naveed Akhtar, Basim Azam
任务设定
研究推理机制对 VLA 模型抗扰动鲁棒性的影响
痛点动机
直觉认为推理更鲁棒,但缺乏系统性验证与安全信号检验
解决方案
对比无推理、文本 CoT、隐式迭代三类 VLA,在视觉/推理/动作阶段施加扰动测试
Juno Kim, Hye-Jung Yoon, Yesol Park, Byoung-Tak Zhang
任务设定
机器人场景中的类别无关3D实例分割
痛点动机
逐帧2D掩码投影融合易致物体身份断裂、实例碎片化
解决方案
跨帧2D掩码跟踪并与3D超点关联,构建2D-3D反馈闭环零样本生成一致3D实例
Nabeela Khan, Bowen Wu, Runwu Shi, Benjamin Yen, Takeshi Ashizawa, Carlos Toshinori Ishi, Takashi Minato, Kazuhiro Nakadai
任务设定
将手语生成的3D人体动作迁移到人形机器人执行
痛点动机
生成动作存在自碰撞,导致IK无解、碰撞及轨迹不稳定
解决方案
提出SMPL-X碰撞消除模块与VLM引导重定向算法修正失败模式
Ziyi Liu, Grace Zhang
任务设定
小样本示范下的逆强化学习新任务泛化
痛点动机
真实任务变化多样,难以为每种场景收集完整示范
解决方案
提出MPG方法,分解可迁移判别器与邻近引导奖励,复用多任务示范
Hye-Jung Yoon, Juno Kim, Yesol Park, Jun-Ki Lee, Byoung-Tak Zhang
任务设定
杂乱料箱中的吸盘抓取机器人拣选
痛点动机
端到端学习方法对未知复杂物体易失效
解决方案
模块化流程:Transformer分割掩码、法向量定抓取点、开放词汇分类识别物体
Yesol Park, Hye-Jung Yoon, Juno Kim, Byoung-Tak Zhang
任务设定
物流拣选场景中未知物体实例分割
痛点动机
纯RGB易过分割、纯深度易欠分割,难应对遮挡堆叠
解决方案
提出可变形注意力RGB-D融合Transformer,并发布拣选数据集OCBD
Joey Páolo Kardolus, Daan Hendriks, Jaap Jansen
任务设定
从参数化人体模型旋转矩阵直接提取临床关节角度
痛点动机
传统关节角度测量工具慢、贵,且局限于实验室环境
解决方案
跳过逆运动学优化,用小型校准表把模型旋转矩阵映射为临床角度,单摄像头视频实时可用
Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang
任务设定
视频中的 3D 场景空间关系推理任务
痛点动机
MLLM 难以从冗余视频观测中稳定聚合空间证据
解决方案
构建几何一致性记忆存储证据,用一致性强化学习提升跨视角稳定性
Yancheng Zhu, Wanli Ma, Chen Han, Irvin Haozhe Zhan, Bingfeng Qin, Yixin Xu
任务设定
四足机器人在动态环境中的视觉导航避障
痛点动机
现有策略仅凭当前观测,难以预判障碍物短期运动趋势
解决方案
训练时用JEPA 式预测器预测未来隐状态,推理时零成本丢弃,实现零样本 sim-to-real 迁移
Zihan Ding
任务设定
博士论文:研究博弈强化学习与基础模型时代的决策方法
痛点动机
预训练生成模型能为序列决策提供更强的结构化先验
解决方案
构建扩散式世界模型,研究视频生成与交互式世界模型中动作如何影响未来观测
Yongheng Zhang, Guang Yang, Ruihan Hou, Qiguang Chen, Ziang Liu, Xiaolong Liu, Manman Zhang, Yanchao Hao, Zheng Wei, Hao Wu, Libo Qin, Peishan Dai, Yinghui Li, Di Yin, Xing Sun
任务设定
评估视频生成模型能否真正对真实世界做因果推理
痛点动机
现有指标割裂了画面真实感与语义因果逻辑的评测
解决方案
提出双重评测框架 CGDJ,分别检验显式因果感知与隐式生成-预测差距,审查世界模型一致性
Yuhang Wen, Mengyuan Liu, Zixuan Tang, Junsong Yuan, Sirui Li, Beichen Ding
任务设定
基于骨骼序列识别人机/人人交互动作
痛点动机
骨骼数据缺乏视觉细节,难以捕捉交互线索
解决方案
用对比学习对齐骨骼与 RGB 视频特征,推理时仅需骨骼即可保留视觉增强效果
Murilo Vinicius da Silva, Ricardo V. Godoy, Juliano Negri, Gustavo J. G. Lahr, Ranulfo Bezerra, Marcelo Becker
任务设定
遥操作机械臂抓取时提供共享自主辅助
痛点动机
纯视觉遥操作难以精确对准目标且易碰撞
解决方案
用视觉语言模型定位开放词汇目标,MPC 控制器实时避障并辅助抓取
Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang
任务设定
机器人操作中融合多模态扩散策略的动作生成
痛点动机
各模态传感频率、延迟不同,同步融合拖慢高频反馈
解决方案
提出 LAG-Fusion 框架,各模态按自身频率异步提供去噪引导,通过参考系重定基准对齐延迟后融合
Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu
任务设定
多视角手物交互视频与3D运动的联合生成
痛点动机
复杂手部运动和遮挡导致多视角一致性难以保证
解决方案
用统一扩散模型联合建模RGB视频与3D点轨迹,用伪视频对齐几何与2D潜空间
Zeyu Shangguan, Rajas Chitale, Rutvik Patel, Satyandra K. Gupta, Daniel Seita
任务设定
预测机器人搬运任务中的失败先兆
痛点动机
现有方法对动态动作敏感、依赖已知策略结构
解决方案
分析物体相对载具的运动,提出PREFAIL方法并标注可干预时间数据集
Yuqi Zhang, Yadan Luo, Xiangyu Sun, Fengyi Zhang, Zi Huang, Xin Tan
任务设定
从多视角图像生成具身场景的 3D 资产
痛点动机
真实场景遮挡多、视角不一致,单图 3D 生成难泛化
解决方案
免训练框架,用关键视角选择和隐空间速度融合整合多视角证据并优化场景布局
Han Wang, Zijun Wang, Shuoshuo Xue, Rui Cao, Fenjiao Cheng, Xiaodang Liang, Roy Ka-Wei Lee
任务设定
用强化学习优化动作条件世界模型的物理与视觉保真度
痛点动机
现有世界模型只靠像素重建损失,难以显式优化物理合理性且泛化差
解决方案
结合 ID 轨迹与噪声驱动的 OOD 动作探索,通过奖励机制显式优化 PAV 目标
Zhaohui Wang
任务设定
研究基于模型的强化学习中风险信号是否可靠
痛点动机
世界模型不确定性代理与真实碰撞风险负相关,标准安全机制反而失效
解决方案
改用世界反馈信号(雷达余量、碰撞时间、结果监督模型)替代模型内部不确定性
Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu
任务设定
评测视频生成模型作为物理世界模型的推理能力
痛点动机
现有基准仅看结果合理性,未验证是否按物理定律推理
解决方案
提出 Apple-π 基准和感知-建模-推演三阶段协议,结合经典力学视频集评测
Usman M. Khan
任务设定
从真实户外机器人视频学习可迁移的世界模型表征
痛点动机
复杂户外场景视觉多变,JEPA 学习鲁棒动态表征困难
解决方案
引入深度先验监督结合各向同性正则化,学习更鲁棒的潜在动态
Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi
任务设定
面向工业场景的零样本 6D 位姿估计与抓取
痛点动机
新品上线常需重新采集数据训练,视觉系统缺乏灵活性
解决方案
结合 CAD 模型与DINOv2、GeDi 等基础模型特征,免微调实现毫米级抗遮挡位姿估计
Yuga Yano, Daiju Kanaoka, Hakaru Tamukoh, Yasutomo Kawanishi
任务设定
面向服务机器人的3D 语言场交互式物体检索
痛点动机
特征压缩致相似物体难辨,且难以处理模糊查询
解决方案
用度量学习构建判别且感知歧义的统一特征空间,模糊时主动请求澄清