1
Bingxin Xu, Yuzhang Shang, Zhen Dong, Emilio Ferrara
任务设定
让代码智能体安全完成机器人操作任务
痛点动机
智能体只顾达成目标,规划时常忽略避障约束
解决方案
提出 SafeHarness ,规划避障路径并感知接触阶段的安全约束
2
Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz
任务设定
长时程机器人操作任务的记忆表示
痛点动机
全历史条件化易致虚假关联,在线 VLM 查询代价高
解决方案
训练期用 VLM 蒸馏出轻量 workspace token ,部署时替代观测
3
Guangzhao He, Hadar Averbuch-Elor, Wei-Chiu Ma
任务设定
评测 4D 基础模型对动态场景的记忆能力
痛点动机
现有基准缺乏物体离开视野后的真值,难以评估记忆
解决方案
提出 PersistBench ,用 360° 视频作全知真值评测物体恒常性等
4
Xin Chen, Sen Chen, Yujuan Ding, Jian Liu, Guoqing Wang, Wei Ye, Heng Tao Shen, Yi Bin
任务设定
VLA 策略中动作分块长度的自适应选择
痛点动机
固定动作视野无法适配任务各阶段变化的控制需求
解决方案
用 Flow Matching 去噪轨迹几何特征衡量预测可靠性,自适应调整动作视野
5
Dennis Rotondi, Abdelrhman Werby, Kai O. Arras
任务设定
从单次静态 RGB-D 扫描恢复可动物体的关节结构与功能部件
痛点动机
现有方法难以同时兼顾运动学恢复与功能交互部件分割
解决方案
复用 TRELLIS.2 生成式 3D 隐空间先验,轻量解码器联合估计运动轴并分割功能部件
6
Zhongbo Zhang, Zaibin Zhang, Yifan Wang, Changbo Yan, Lijun Wang, Huchuan Lu
任务设定
让 3D 扩散策略具备对未来交互趋势的预见能力
痛点动机
现有策略仅隐式学习运动可行性,缺乏对交互走向的预判
解决方案
从历史观测学习潜在运动趋势,仅作条件引导扩散策略生成,不显式规划轨迹
7
Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong
任务设定
无需机器人在环的 VLA 模型人机协同后训练
痛点动机
静态数据覆盖有限,标准模仿学习难辨优质行为
解决方案
用 UMI 手持采集对比策略推理触发数据采集,结合优势估计做行为克隆
8
Yan Qin, Yue Chen, Wenwei Lin, Shujia Liu, Chuqiao Lyu, Kailun Su, Chenze Yu, Ping Luo, Wenbo Ding, Tianxing Chen, Renjing Xu
任务设定
学习触觉世界模型用于灵巧机器人操作预测
痛点动机
机器人接触式交互数据采集昂贵,难以规模化
解决方案
用人手佩戴压阻触觉阵列采集数据,动作重定向后联合训练视触觉世界模型
9
Di Wen, Kailun Yang, Jimmy Weissert, Luc Maria Scherrer, Cedric Zöllner, Ruiping Liu, Yufan Chen, Jiale Wei, Junwei Zheng, Kunyu Peng
任务设定
第一视角视频中在线检测操作步骤错误
痛点动机
现有方法仅截取到首次错误处评估,难应对完整真实流程
解决方案
跟踪流程状态与执行进度的贝叶斯后验,序列检验触发错误告警
10
Di Wen, Kailun Yang, Wenhao Guo, Yitian Shi, Junwei Zheng, Yufan Chen, Ruiping Liu, Jiale Wei, Rania Rayyes, Kunyu Peng
任务设定
机器人学习为装配检查选择最佳观察视角
痛点动机
缺乏目标域视角标注,难以直接训练视角选择策略
解决方案
从智能眼镜助手问答记录中学习视角偏好,无需候选图像即可选视角
11
Zhikun Zhou, Kunyu Peng, Runyi Yang, Junhao Cai, Di Wen, Ruiping Liu, Danda Pani Paudel, Yi Zhou, Luc Van Gool, Kailun Yang
任务设定
多机器人协同场景下的语言指代目标定位
痛点动机
融合地图后需保持跨智能体语义一致性与视角相关关系推理
解决方案
构建开放词汇实例级高斯地图,跨机器人对齐后用视角条件关系图做指代定位
12
Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham
任务设定
学习四足/人形机器人的视觉运动与操作策略
痛点动机
纯一阶策略梯度易陷入错误接触模式局部最优
解决方案
将采样式 MPC 优化与一阶策略梯度交替训练,实现深度视觉策略零样本迁移到真实机器人
13
Sheng Wu, Guoqiang Zhao, Zhe Yang, Fei Teng, Zhikun Zhou, Yanlin Yang, Zheng Fang, Hong Zheng, Yaonan Wang, Kailun Yang
任务设定
用动物示范训练全向多步态四足机器人
痛点动机
示范方向单一,侧向/倒退/转向缺乏一致性监督
解决方案
通过动力学补全与镜像/时间反转扩增数据,结合门控专家网络统一多步态策略
14
Euiseok Han, Tri Ton, Hwanhee Kim, Seungyeon Ryu, Chang D. Yoo
任务设定
面向机器人的开放词表 3D 实例分割任务
痛点动机
现有方法仅依赖 2D 图像特征,未充分利用 3D 形状信息
解决方案
无标签融合 2D 图像编码器 与 3D 形状编码器,自适应选权重提升标注质量
15
Danyan Zhou, Jinxuan Lu, Jiawei Lin, Tianxing Chen, Chuqiao Lyu, Wenbo Ding
任务设定
从第一视角视频预测赤手的密集接触力
痛点动机
触觉数据需接触式手套采集,规模化和裸手泛化困难
解决方案
用 500 小时手套数据训练,并靠生成式视频模型把手套画面转成裸手图像做数据增强
16
Wenyuan Xie, Mengyang Hong, Yongzhong Wang, Yanbiao Ji, Yijin Zhou, Shaokai Wu, Shalayiding Sirejiding, Huayi Zhou, Yi-Chao Chen, Ma Ling, Yue Ding, Hongtao Lu
任务设定
连续环境下的零样本视觉语言导航( VLN-CE )
痛点动机
去几何定位后,长时空间状态维持与错误恢复困难
解决方案
构建无坐标拓扑图,用视觉观测做自定位、进度校验与回溯纠错
17
Shuai Liu, Hechangle Gong, Hao Jiang, Runlin He, Junxiang Zhan, Kai Huang, Sheng Yang, Shaoqing Ren
任务设定
自动驾驶中的世界-动作联合建模与轨迹规划
痛点动机
决策与场景演化存在多模态耦合的不确定性,单模式建模不够
解决方案
用扩散 Transformer 生成多组场景-动作假设并双向协同演化,再据未来预测打分排序
18
Yuang Tu, Runjia Tan, Yujie Yan, Jinghan Hu, Chen Lv
任务设定
让机器人奖励模型适配不同相机视角与遮挡
痛点动机
视角/遮挡变化会使奖励预测漂移,即使任务状态未变
解决方案
用 Plucker 射线编码相机几何,配合 LoRA 微调与多视角注意力融合观测
19
Loan Bernat, Matthieu Grard, Ariane Herbulot, Florent Lamiraux
任务设定
为分层机器人长时程操作生成失败恢复监督数据
痛点动机
失败轨迹存在歧义性,常规监督/强化学习均难利用
解决方案
特权教练诊断错误并提出恢复动作,仅保留重执行验证确实改善的样本作监督
20
Xin Zhou, Cong Miao
任务设定
构建实时可控的视频世界模型基础架构
痛点动机
现有世界模型难兼顾实时流式生成与相机/动作可控性
解决方案
块因果注意力+KV 缓存实现流式生成,PRoPE 编码相机位姿并用动作流逐层调制
21
Enpeng Li, Yunzhou Zhang, Zhiyao Zhang, Dexuan Lyu, Chenyu Wang, Chiyuan Cui, Cheng Cheng
任务设定
长单目序列的前馈式 3D 重建
痛点动机
长轨迹易漂移且局部几何质量差,难保持全局一致性
解决方案
用 LoRA 蒸馏单目几何先验,结合稀疏光线场优化保证跨帧一致并减少漂移
22
Zitai Huang, Taiyi Su, Jian Zhu, Jianjun Zhang, Chong Ma, Tianbin Liu, Weiyi Lu, Yi Xu, Hanli Wang
任务设定
长时程机器人操作中的实例级目标跟踪与调度
痛点动机
多个外观相同物体需按序操作时,低层策略难判断该动哪个、何时切换
解决方案
用目标掩码连接高层任务规划与低层操作策略,视觉反馈验证子任务完成状态并更新目标
23
Long Wang, Shuting Zhao, Shen Yan, Siyuan Yu, Xiaoben Li, Zeyu Cai, Yumeng Hou, Yuliang Xiu
任务设定
从无序、嘈杂的动捕标记点恢复人体全身运动
痛点动机
传统光学动捕依赖固定标记布局,实际中标记稀疏、噪声大且布局多变
解决方案
将标记映射到固定的代理锚点,再用可微分高斯-牛顿求解器拟合 SMPL-H 模型
24
So Kuroki, Yujin Tang
任务设定
生成并迁移闭环机器人策略代码到新任务
痛点动机
手写带分支判断的闭环策略代价高,难泛化
解决方案
用编程智能体从演示生成策略代码,靠仿真反馈迭代优化并归档复用
25
Chunpeng Li, Ya-tang Li
任务设定
自动合成大规模自我中心双目视觉数据
痛点动机
真实世界双目自我中心数据采集标注成本极高
解决方案
用程序化场景合成生成双目视频及深度、光流等多模态标注,提升真实感知效果
26
Yunqian Cheng, Roberto Manduchi
任务设定
大型建筑内自我中心视觉楼层平面定位评测
痛点动机
现有方法多针对小型住宅,难泛化到大型公共建筑
解决方案
用 Aria 眼镜采集多栋校园建筑数据并标注,微调后定位精度大幅提升
27
E-In Son, Dong-Wook Kim, Ji-Hoon Hwang, Kangsun Lee, Jisung Bae, Jung-Taak Kim, Seung-Woo Seo
任务设定
越野导航世界模型预测机器人触地体感
痛点动机
越野场景仅预测画面不够,需预知打滑颠簸风险
解决方案
引入本体感觉联合视觉预测未来状态与失败风险,规划时主动避开危险地形
28
Maxime Alvarez, Renzo Caballero, Tatsuya Matsushima, Yusuke Iwasawa, Yutaka Matsuo
任务设定
潜在动作模型的跨机器人形态策略迁移
痛点动机
不同机器人执行同一动作时潜变量表示不一致
解决方案
用动作相似度监督对齐潜在动作空间,无需预测真实动作即可提升跨形态泛化
29
Suji Kang, Seok-Young Kim, Young Bin Kim, Taewook Ha, Dieter Schmalstieg, Shohei Mori, Woontack Woo
任务设定
从单张图像重建 3D 物体并估计物理属性
痛点动机
视频分析耗时,纯 VLM 推理缺乏几何依据
解决方案
结合实例级 3D 重建与物理感知场景图,为 VLM 推理提供结构化上下文
30
Xu Yuan, Yi Wang, Zhuohang Jiang, Haohao Qu, Yujuan Ding, Shanru Lin, Guoliang Xing, Hongxia Yang, Jiannong Cao, Qing Li, Wenqi Fan
任务设定
综述 AI 智能眼镜从第一人称感知到个性化助理的系统设计
痛点动机
智能眼镜正从拍摄显示设备转向可穿戴 AI 系统,需系统梳理
解决方案
从硬件、具身智能、交互设计、应用场景四维度组织综述
31
Enhao Wu, Fusen Guo, Yuxin Cao, Ziyang Lyu, Lin Li, Wei Song
任务设定
评估 VLA 策略遭对抗补丁攻击后移除补丁的持续影响
痛点动机
现有评测未区分即时动作破坏与补丁移除后的持续状态影响
解决方案
提出状态恢复协议分离两类效应,并训练恢复适配器提升可恢复性
32
Haodi Hu, Kaen Kogashi, Toshiaki Koike-Akino
任务设定
触觉引导的灵巧机器人寿司操作任务
痛点动机
食物操作存在形变、遮挡与接触不确定性
解决方案
基于 Cosmos3 世界-动作模型,用门控触觉融合结合未来结果监督训练策略
33
Zhongbo Zhang, Jiayi Jin, Yifan Wang, Zaibin Zhang, Haiwen Diao, Lijun Wang, Huchuan Lu
任务设定
评测具身智能体的主动感知与精细操控能力
痛点动机
现有模型缺乏观察-推理-行动-修正的完整闭环
解决方案
提出 VABench 基准,含单/双臂任务,测试主动视角选择与度量级控制指令
34
Lyuxing He, Daniel Guo, Elizabeth Terveen, Deepak Pathak, David Held, Tal Daniel
任务设定
自监督学习物体中心的 3D 场景表示
痛点动机
2D 隐粒子方法难以支持机器人操作所需的 3D 空间推理
解决方案
结合深度隐粒子与前馈 3D 高斯溅射,构建可编辑的 3D 隐粒子空间
35
Jiuyi Xu, Jinjia Guo, Meida Chen, Jing Du, Yangming Shi
任务设定
预测世界动作模型量化后的任务性能下降
痛点动机
闭环评估量化配置代价高,需离线提前判断
解决方案
用离线动作偏差校准阈值,判断接受、拒绝或延后部署配置
36
Jing Jiang, Yue Yang, Xinkai Jiang, Gedas Bertasius, Daniel J. Szafir, Rudolf Lioutikov
任务设定
自动化长时程机器人操作评估中的场景重置
痛点动机
人工重置耗时,现有方法仅支持单步任务
解决方案
用场景图规划原子重置技能组合, LLM 负责评分与验证
37
Ruiyang Wang, Hao-Lun Hsu, Swarajh Mehta, Jiwoo Kim, Zhihao Dou, Miroslav Pajic
任务设定
LLM 长时程机器人任务规划的验证与修复
痛点动机
LLM 生成计划常违反具身约束、难以从错误恢复
解决方案
用图世界模型预测动作后果并自动修复错误,仅语义错误才用 LLM 重规划
38
Tianbin Liu, Jian Zhu, Taiyi Su, Jianjun Zhang, Chong Ma, Zitai Huang, Yi Xu
任务设定
提升 世界动作模型 对文本指令的跟随能力
痛点动机
视觉-动作轨迹丰富但语言标注稀疏,模型难以真正理解指令语义
解决方案
用文生图生成多样 视觉目标图,经 V-JEPA 编码成目标 token 引导生成
39
Juno Kim, Yesol Park, Hye-Jung Yoon, Byoung-Tak Zhang
任务设定
室内机器人开放词汇 3D 场景查询与实例分割
痛点动机
余弦相似度检索对相近标签、多实例场景易出错
解决方案
置信度感知由粗到细框架,低置信度查询才调用 VLM 推理重排序
40
Hung Le Chi, Khanh Minh Huynh, Long Nghia Tran Pham, Tan Phuc Huynh, Trong-Thuan Nguyen, Minh-Triet Tran
任务设定
基于单张 RGB 图像的瑜伽姿势分类与关节级纠正
痛点动机
现有方法难辨相似姿势,分类与纠正相互割裂
解决方案
多视觉骨干集成投票,配合几何验证仅在姿势模糊时启用,实现由粗到细分类与关节纠正