Junyi Hu, Shuaihang Yuan, Geeta Chandra Raju Bethala, Anthony Tzes, Yi Fang
任务设定
机器人视觉导航中自适应安全边界的选择
痛点动机
固定安全边界导致绕路或贴近障碍冒进
解决方案
用扩散规划器生成轨迹候选,训练安全评论家筛选排序,蒸馏为纯感知选择器并部署到 Unitree G1 人形机器人
Peiran Xu, Jiaqi Zheng, Ziyou Wang, Yadong Mu
任务设定
统一多模拟器的具身任务规划基准
痛点动机
各模拟器观测/动作格式不一,难以统一评测和扩展训练数据
解决方案
整合四大模拟器为统一观测-动作空间,自动构建多难度任务数据集
Lingfeng Zhang, Zhanguang Zhang, Liheng Ma, Tongtong Cao, Yingxue Zhang
任务设定
视觉-语言导航中让策略提前预判未来观测
痛点动机
传统行为克隆只监督下一步动作,未显式利用未来视觉信息
解决方案
引入未来查询 token ,训练时对齐未来帧潜特征,推理时无需未来图像即可提升导航效果
Letian Cheng, Qi Zhang, Yisen Wang
任务设定
潜在世界模型长时程规划中的候选动作生成
痛点动机
规划步长变长后固定候选预算难以搜索指数级增长的动作空间
解决方案
用目标条件生成器预测未来潜在子目标以引导候选动作生成,再由世界模型评估筛选
Lingyu Kong, Ruicheng Li, Ruicheng Wang, Sicheng Xu, Chengtang Yao, Jianfeng Xiang, Jiaolong Yang
任务设定
单目图像细粒度 3D 几何估计,还原细小结构
痛点动机
现有方法在 2D 图像平面解码几何,导致细长结构过度平滑失真
解决方案
将粗略点云提升到稀疏体素空间,用稀疏卷积在真实 3D 空间中精细化几何
Yongyan Wen, Feifan Liu, Jinyi Chen, Bo An, Peng Liu, Siyuan Li
任务设定
长时序机器人操作任务中技能选择过程不透明
痛点动机
现有方法把技能选择当黑箱映射,难以人工监督和干预
解决方案
提出 ConceptTree ,用可解释概念谓词序列表示策略,训练决策树预测高层技能
Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao
任务设定
基于 Pangu 大模型的视觉语言导航动作预测
痛点动机
适配大模型需视觉对齐、时序压缩与动作空间对齐
解决方案
两阶段训练: Q-Former 对齐视觉语言,再用 LoRA 微调导航轨迹动作预测
Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang
任务设定
从单目第一人称视频联合重建人体与场景 4D 表征
痛点动机
现有方法依赖预计算相机轨迹,割裂场景与人体运动建模
解决方案
提出掩码生成式 Transformer 统一预测 RGB、轨迹、凝视、全身与手部动作及深度
Tuan Duong Trinh, Naveed Akhtar, Basim Azam
任务设定
研究推理机制是否提升 VLA 模型抗扰动鲁棒性
痛点动机
直觉认为先推理再行动应更鲁棒,但缺乏系统验证
解决方案
对比三种推理范式,发现隐式迭代推理模型鲁棒性最差,一致性探针难防御自适应攻击
Nabeela Khan, Bowen Wu, Runwu Shi, Benjamin Yen, Takeshi Ashizawa, Carlos Toshinori Ishi, Takashi Minato, Kazuhiro Nakadai
任务设定
手语生成动作到人形机器人的重定向执行
痛点动机
生成动作自穿模,导致 IK 求解失败与碰撞
解决方案
用 SMPL-X 碰撞消除模块修正动作,再用 VLM 视觉评判引导重定向优化
Ziyi Liu, Grace Zhang
任务设定
少样本演示学习新的机器人操作/导航任务
痛点动机
真实任务变化多,少样本演示难覆盖全部场景
解决方案
学习可迁移判别器奖励识别专家行为,用邻近度引导修正探索偏差
Joey Páolo Kardolus, Daan Hendriks, Jaap Jansen
任务设定
从参数化人体模型旋转矩阵直接提取临床关节角度
痛点动机
传统关节角度测量依赖实验室设备,慢且昂贵,难以普及
解决方案
用单部手机视频驱动 GEM-X 等人体模型,通过校准表免优化直接换算角度,精度媲美专业方案且可迁移到 SAM 3D Body
Yancheng Zhu, Wanli Ma, Chen Han, Irvin Haozhe Zhan, Bingfeng Qin, Yixin Xu
任务设定
四足机器人动态环境下的视觉导航避障策略学习
痛点动机
反应式策略只依当前观测决策,对障碍物运动预判不足易碰撞
解决方案
训练时用 JEPA 式预测器监督循环隐状态预测未来,推理时舍弃、零额外开销,Go2 实机验证 sim-to-real 零样本迁移
Zihan Ding
任务设定
综述强化学习从博弈算法到基础模型时代的发展
痛点动机
传统 RL 难以应对高维世界的规划与长程决策
解决方案
研究扩散世界模型、生成式策略类,及动作驱动的交互式视频世界模型
Yongheng Zhang, Guang Yang, Ruihan Hou, Qiguang Chen, Ziang Liu, Xiaolong Liu, Manman Zhang, Yanchao Hao, Zheng Wei, Hao Wu, Libo Qin, Peishan Dai, Yinghui Li, Di Yin, Xing Sun
任务设定
评估视频生成模型能否真正推理真实世界因果关系
痛点动机
逼真视频可能只是记忆表象而非因果理解,现有指标难辨真伪
解决方案
提出 Causal-Generative Dual-Judge ,从显式因果感知与隐式生成预测差距双重审计世界模型一致性
Yuhang Wen, Mengyuan Liu, Zixuan Tang, Junsong Yuan, Sirui Li, Beichen Ding
任务设定
基于骨骼序列的人机/人人交互识别
痛点动机
骨骼数据缺乏视觉信息,难以捕捉交互线索
解决方案
通过骨骼与 RGB 对比对齐学习交互特征,推理时仅用骨骼保持高效
Murilo Vinicius da Silva, Ricardo V. Godoy, Juliano Negri, Gustavo J. G. Lahr, Ranulfo Bezerra, Marcelo Becker
任务设定
基于开放词汇的机器人抓取共享自主系统
痛点动机
纯视觉遥操作难精准对齐目标,易发生碰撞
解决方案
用视觉语言模型定位目标,结合 MPC 控制器避障精准抓取
Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang
任务设定
机器人接触式操控中融合视觉与力觉等异步多模态策略
痛点动机
现有多模态扩散策略同步融合会拖慢高频反馈、限制扩展性
解决方案
提出延迟感知引导融合,各模态策略按自身频率异步生成去噪引导并对齐后融合
Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu
任务设定
多视角手物交互视频与 3D 轨迹联合生成
痛点动机
手部运动复杂多遮挡,多视角几何一致性难保证
解决方案
用扩散 Transformer 联合建模 RGB 视频与 3D 点轨迹,再用全局运动对齐扩散精修为度量尺度轨迹
Zeyu Shangguan, Rajas Chitale, Rutvik Patel, Satyandra K. Gupta, Daniel Seita
任务设定
预测机器人非抓取式搬运任务中的失败前兆
痛点动机
高速搬运易失败,现有方法难判断能否及时干预
解决方案
分析目标物体相对托盘的相对运动预测失败,并标定最晚干预时刻
Yuqi Zhang, Yadan Luo, Xiangyu Sun, Fengyi Zhang, Zi Huang, Xin Tan
任务设定
面向具身应用的多视角 3D 场景资产生成
痛点动机
单视角生成难处理真实场景遮挡与跨视角不一致
解决方案
免训练扩展 SAM3D ,融合互补视角证据并用轻量高斯优化精修场景布局
Han Wang, Zijun Wang, Shuoshuo Xue, Rui Cao, Fenjiao Cheng, Xiaodang Liang, Roy Ka-Wei Lee
任务设定
优化动作条件世界模型的物理性与视觉保真度
痛点动机
现有方法只用专家数据像素重建,分布外动作泛化差
解决方案
用强化学习显式优化 PAV 目标,结合专家轨迹与噪声驱动 OOD 探索
Zhaohui Wang
任务设定
探讨世界模型不确定性能否作为安全风险信号
痛点动机
该代理与真实碰撞风险负相关,用其做安全约束反而更危险
解决方案
改用世界反馈信号(激光雷达余量、碰撞时间等)替代模型内部不确定性
Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu
任务设定
评估视频生成模型作为物理世界模型的推理能力
痛点动机
现有基准只看结果是否合理,未验证推理过程是否遵循物理定律
解决方案
构建 Orchard 基准,用感知-建构-推演三阶段协议逐层诊断物理推理瓶颈
Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai
任务设定
用物理仿真引导视频生成,保证物理合理性
痛点动机
单次生成的物理程序难以准确还原复杂运动与交互
解决方案
提出 PhysAgent 反思式智能体,通过仿真验证与程序修正闭环持续优化物理参数
Usman M. Khan
任务设定
从真实户外机器人视频中学习世界模型潜在表示
痛点动机
复杂户外场景下学习鲁棒潜在动力学很困难
解决方案
引入深度几何先验与各向同性正则化,配合过参数化提升世界模型表征质量
Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi
任务设定
面向工业抓取场景的零样本 6D 位姿估计
痛点动机
新物体上线常需重新采集数据并微调,部署慢
解决方案
结合 CAD 模型与 DINOv2、GeDi 等基础模型特征,实现免微调的高精度位姿估计
Yuga Yano, Daiju Kanaoka, Hakaru Tamukoh, Yasutomo Kawanishi
任务设定
面向服务机器人的交互式 3D 场景物体检索
痛点动机
特征压缩降低物体区分度,模糊查询易检索出错
解决方案
提出度量学习构建判别性与歧义感知的统一 3D 语言场特征空间,支持交互澄清
Bingrui Sima, Lizhong Wang, Xiaoya Lu, Kun He, Xiao Yang
任务设定
具身智能体在家庭任务中主动应对突发安全隐患
痛点动机
现有安全护栏靠阻断动作保安全,却严重拖慢任务进度
解决方案
提出自演化即时记忆框架,结合信念图与经验记忆,测试时循环优化缓解技能