1
Bingxin Xu, Yuzhang Shang, Emilio Ferrara
任务设定
长时程机器人多阶段操作任务的规划与执行
痛点动机
VLA 误差随阶段累积,子任务缺乏转移条件导致衔接失败
解决方案
LLM 智能体做高层规划,按子任务探索并用转移感知记忆串联长时程轨迹
2
Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu et al. (13 additional authors not shown)
任务设定
评估视频世界模型生成结果是否符合物理规律
痛点动机
现有评测只给分数,缺乏可验证的推理依据
解决方案
引入智能体化评测流程,分解问题并生成可追溯的证据链
3
Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang
任务设定
将通用 VLA 模型迁移至人形机器人全身移动操作
痛点动机
全身动作维度高、强耦合,直接在线 RL 微调大模型代价高且有风险
解决方案
HAF-VLA 分阶段生成全身动作, HAF-Steer 用隐空间 RL 低成本微调
4
Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan, Benjamin Graham, Jeffrey Hawke
任务设定
评测视频世界模型生成结果的物理统计校准度
痛点动机
现有基准仅看单次生成或粗粒度分布,忽略细粒度随机性是否合理
解决方案
用离散化结果空间(如骰子点数)比对参考分布,量化可评分率与校准误差
5
Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha
任务设定
让智能体完成长时程家庭具身任务并生成可执行计划
痛点动机
视觉语言模型生成的计划常违反环境动态或实体定位错误
解决方案
先用 VLM 视觉探索获取符号初始状态,再用 PDDL 约束解码结合蒙特卡洛树搜索规划
6
Aniri, Chen Yilin, Jinhe Bi, Junfei Guo, Donglai Ran, Xu Bian, Zengjie Jin, Yujun Wang, Yijun Tian, Volker Tresp, Fei Shen, Tat-Seng Chua, Yunpu Ma
任务设定
让 VLA 模型在无监督下自评估动作生成可靠性
痛点动机
现有方法依赖专家标注或仅看输出统计,忽略内部信号
解决方案
提出 MAE 框架,用注意力熵建模马尔可夫链评估可靠性,支持测试时动作筛选
7
Zhijian Li, Chao Ren, Peijin Wang, Xian Sun
任务设定
卫星在轨自主避障导航中的碰撞风险预测
痛点动机
传统规划器依赖预定义地图,难以适应动态轨道环境
解决方案
提出两阶段潜在世界模型 Orbit-Planner ,用物理探针从想象轨迹解码物理状态
8
Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen
任务设定
统一评估具身智能从仿真基准到真实机器人的表现
痛点动机
评测体系碎片化,仿真与真实差距难以统一衡量
解决方案
提出任务-资源-结果统一框架,用同源追踪连接仿真与真实机器人评测
9
Cong Zhao, Shuai Tian, Xu Zhang, Baocheng Ni, Xinguo Song, Xueying Sun, Shu Jiang, Shouchang Yang, Bo Tang, Jin Deng, Ge Zhu, YongCheng Wang, Jin Xu, Ri Yang
任务设定
机器人操作中的视觉-语言-动作模型高效控制
痛点动机
现有 VLA 模型效率与性能难以兼顾,跨本体泛化困难
解决方案
用双频异步架构解耦推理与控制,统一动作表示提升跨本体泛化与平滑性
10
Jianchun Yang, Jian Liang, Xianda Guo, Pinhan Fu, Yanlun Peng, Conglang Zhang, Wenke Huang, Mang Ye
任务设定
加速自动驾驶世界模型的视频生成推理
痛点动机
扩散模型多步去噪评估开销大,限制生成吞吐量
解决方案
利用自车运动轨迹信号,动态规划分配去噪步间的特征复用
11
Louen Pottier
任务设定
从单目视频推断可交互的物理动力学场景
痛点动机
常见解码器无法把图像空间外力回传到运动方程
解决方案
用拉格朗日隐变量兼任广义坐标与高斯泼溅条件,实现受力实时仿真
12
Tianchen Deng, Xuefeng Chen, Shuang Wu, Qu Chen, Jiajun Zhu, Bo Dai, Jianfei Yang, Hesheng Wang
任务设定
基于 3D 高斯 的驾驶场景理解、编辑与生成统一模型
痛点动机
现有驾驶世界模型缺乏显式 3D 理解和语言对齐能力
解决方案
将视觉语言特征蒸馏进 3D 高斯基元,构建可指令编辑的语义场景表示
13
Jiahao Ji, Ji Ma, Runhan Zhang, Runyi Yu, Wenjia Wang, Weiheng Chi, Qianqian Peng, Weichao Yan, Yongfei Gu, Ye Tian, Ting Wu, Longwei Li, Chun Yuan, Ruoli Dai, Lei Han
任务设定
构建高精度全身人体动作与物体交互大规模数据集
痛点动机
现有数据集要么缺乏物理标注要么行为覆盖窄,制约人形策略学习
解决方案
用光学动作捕捉采集 600+ 小时全身动作,提供亚毫米级标记与物体网格轨迹
14
Tao Feng, Xu Li, Xiangyang Luo, Ming Wen, Huadai Liu, Chen Zhang, Wei Xue
任务设定
根据参考图像、文本和音频生成边唱边跳的人物视频
痛点动机
现有方法难以同时处理演唱口型与舞蹈动作生成
解决方案
提出角色感知音频条件扩散框架,实现零样本组合式歌舞生成
15
Rocky Liu, Tengyu Liu, Baoxiong Jia, Fangwei Zhong, Xinyi Tong, Hongzhao Xie, Siyuan Huang
任务设定
复杂非结构化地形上训练腿式机器人运动策略
痛点动机
地形难度无法预先定义,人工课程设计难以泛化
解决方案
提出轨迹级自动课程学习,动态学习难度函数生成训练轨迹课程
16
Yizhao Wang, Xinfa Wang, Jingbo Wang, Jingbo Wang, Guantao Zhang, Yafeng Han, Guohong Gao, Yuhe Xia
任务设定
3DGS 场景中的开放词汇指代分割
痛点动机
全局文本-区域相似度难应对属性、空间关系等复杂表达
解决方案
提出 QAGaussian ,用查询自适应高斯槽及关系图做结构化推理
17
Cheng Zhang, Xingzheng Wu, Guihao Yan, Xifeng Hu, Zhi Liu, Mei Wu, Qing Cai
任务设定
超声扫描机器人的探头操控动作生成
痛点动机
现有 RL 方法依赖精细奖励设计和大量交互数据,泛化性和稳定性差
解决方案
提出 US-VLA :融合超声语义反馈,基于专家轨迹数据训练探头动作生成
18
Mary Lynn Martin, Yifei Zhang, Martha Palmer, Maria Leonor Pacheco
任务设定
评测语言指令引导的 3D 场景物体摆放
痛点动机
指令定义的是可行摆放区域而非单点坐标,评估困难
解决方案
提出 ReRef-3D 基准,插入预测位置后检验关系满足与物理合理性
19
Shaohui Lin, Zhenwu Shi, Jingyu Gong, Jiao Xie, Yu Zhou, Baochang Zhang, Lizhuang Ma, Chia-Wen Lin
任务设定
文本驱动的 3D 人体动作编辑
痛点动机
现有方法难平衡文本改变与运动连贯性,易致失真
解决方案
提出 CIME 框架,解耦时空维度,用 RNIMM 模块保持物理节奏保真
20
Kaname Yokoyama, Norimichi Ukita
任务设定
让 3D 动作语言模型接受 2D 动作输入
痛点动机
单目视频难获取准确 3D 动作,限制实际应用
解决方案
提出即插即用 2D 动作接口,无需微调对接现有 MoLM
21
Sarthak Kamat, Adam Rashid, Satvik Sharma, Aseem Doriwala, Chelsea Finn, Phillip Isola, C. Karen Liu
任务设定
为 56 自由度双臂灵巧手操作策略做预训练
痛点动机
真实遥操作数据昂贵,人手视频跨具身误差大
解决方案
让人在 VR 中操作虚拟物体采集机器人视角数据,训练因果 Transformer 后用少量真实演示微调
22
Yuxing Long, Lei Kang, Ziyan Yu, Yuzheng Gao, Bin Cheng, Jiyao Zhang, Xiaoqi Li, Haolin Yang, Dongjiang Li, Hui Shen, Hao Dong
任务设定
让机器人根据家电说明书完成长时程操作规划
痛点动机
现有模型缺乏支持家电操作规划的多样化数据集
解决方案
构建 分层电器图谱 自动合成数据,训练端到端 AppliancePlan 模型并实现真实机器人部署
23
Genying Li, Boda Lin, Jiachen Li, Zijian Jia, Haojie Zheng, Yiming Wang, Shuchen Weng, Si Li
任务设定
根据音乐生成对应的舞蹈视频
痛点动机
需同时保证动作与音乐对应、身份一致和时序连贯
解决方案
采用并行 姿态 与 RGB 双流,结合时间步感知的姿态注入与身份保持机制
24
Yijie Xu, Haopeng Jin, Run Zhou, Shengbang Liu, Sixiang Chen, Hongyang Cheng, Sicheng Hu, Peterson Co, Jinwen Luo, Huajie Tan, Shanghang Zhang
任务设定
为机器人操作的 VLA 策略学习设计过程奖励模型
痛点动机
稀疏成功信号难探索, OOD 状态下奖励区分度弱
解决方案
提出历史条件成对奖励,结合带符号进度空间与课程学习区分进展、失败与恢复
25
Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge
任务设定
构建带丰富标注的世界探索合成视频数据引擎
痛点动机
真实采集难同时提供密集几何、长程对应等多种标注
解决方案
用虚幻引擎离线渲染场景,同步生成深度、轨迹、光流与点跟踪等标注
26
Bin Ren, Qi Ma, Yue Li, Zongyan Han, Yidi Li, Yuqian Fu, Rao Muhammad Anwer, Theo Gevers, Fahad Shahbaz Khan, Salman Khan
任务设定
面向 3D 高斯泼溅的自监督表征学习
痛点动机
现有重建式方法绑定单一采样实现,泛化性受限
解决方案
借鉴 JEPA 框架,在潜在空间预测被遮挡高斯块特征而非重建属性
27
Chunyu Qi, Zhuoran Song, Jian Weng, Haozhe Jiang, Xueyuan Liu, Naifeng Jing, Guanghui He, Xiaoyao Liang, Haibing Guan
任务设定
加速 VLA 模型在机器人上的实时推理
痛点动机
VLA 计算量大、预测动作短,难以实时部署
解决方案
利用主动/非主动状态特性,推测预测配合轻量验证模型 sVLA 做算法-硬件协同加速
28
Matteo Stoiber, Niels Buus Lassen
任务设定
端侧预测第一视角注视点以裁剪视频降低 token 开销
痛点动机
现有方法依赖专用眼动仪,消费级智能眼镜无此硬件
解决方案
提出轻量双过程注视预测器,纯软件实时运行,效果媲美真实眼动数据
29
Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao, Yu-Chee Tseng, Jen-Jee Chen
任务设定
消除 VLM 对自我/他我中心参照系的空间歧义理解
痛点动机
语言描述常省略参照系,易致具身机器人执行出错
解决方案
构建 AlloEgo-View 数据集微调 VLM ,并在 Isaac Sim 机器人平台验证
30
Swarnim Jain, Shangzhe Wu
任务设定
评测视频生成模型的刚体物理准确性
痛点动机
现有指标混合多种误差,难以分辨物体运动是否正确
解决方案
构建仿真对齐的 RigidBench 基准,分维度评测运动轨迹等指标
31
Ao Zhou, Bo Dai, Le Yu, Xingyu Liu, Zeyu Hao, Lingkun Long, Chunming Hu, Jianlei Yang
任务设定
面向 VLA 模型的端边协同推理部署
痛点动机
端侧算力能耗有限,边缘卸载又受网络波动影响,难兼顾实时与节能
解决方案
提出 EcoVLA 框架,联合建模时延与能耗,动态选择最优协同推理方案
32
Yudong Gao, Linghan Chen, Wenhan Wu, Mia Zhou, Jiyao Wang, Kaiyan Ji, Mingyu Guo, Honglong Chen
任务设定
研究对 VLA 模型的位翻转攻击安全性
痛点动机
量化 INT8 部署下少量比特翻转即可致机器人操作完全失效的风险
解决方案
定位动作生成层关键比特,比较不同动作头架构的攻击脆弱性并提出防护方案
33
Yufei Guo, Yinan Wu, Haoran Duan, Guiguang Ding, Jungong Han
任务设定
为连续动作 VLA 策略做分阶段自适应微调
痛点动机
静态 LoRA 更新忽略操作任务各阶段的差异
解决方案
提出 PhaseLoRA ,依据控制阶段描述符动态调制 LoRA 更新方向
34
Yang Liu, Yuming Chen
任务设定
探究世界模型隐藏状态与反事实未来的关系
痛点动机
世界模型能预测未来,但不清楚哪些状态在起作用
解决方案
构造低秩隐状态载体,一次编辑就让模型自主展开到指定反事实轨迹
35
Yihong Ji, Jinsong Zhang, He Hu, Hongbo Xu
任务设定
生成人与物体交互( HOI )的动作序列
痛点动机
扩散式方法迭代去噪易产生伪影和不稳定交互
解决方案
提出离散掩码生成模型 HOIMask ,用 VQ 编码人物-物体 token 图,结合接触感知引导优化生成
36
Peng Jia, Li Dai, Zhen Xiao, Xueliang Liu, Jia Li
任务设定
音频驱动 3D 说话人头生成,实现情感连续控制
痛点动机
离散情绪类别难以刻画连续情感变化,且音画频率错配
解决方案
提出 CETalk ,用连续效价-唤醒度驱动 FLAME 参数,多尺度时序解耦唇动与情绪
37
Zihang Wang, Yishan Wang
任务设定
人机协同在线机器人强化学习
痛点动机
需快速吸收人工干预,同时持续超越人类先验策略
解决方案
提出 MC Q-chunk 评论家与 max-Q 选择性模仿,按状态选高 Q 动作模仿更新
38
Wenkang Zhang, Chengbo Yuan, Zicheng Zhang, Zhengxue Cheng, Yang Gao
任务设定
从第一视角视频预测手部触觉信号
痛点动机
触觉数据难采集,而第一视角视频丰富易得
解决方案
构建 570 万图像-触觉对数据集训练通用模型,实现零样本触觉预测
39
Yuhua Jiang, Jiaming Wang, Qingbin Liu, Feifei Gao
任务设定
对冻结的视频世界模型做推理时自适应优化
痛点动机
推理阶段多组件联动易导致评估归因不清
解决方案
以可审计的类型化状态做有界更新,冻结策略后再评估
40
Xingzheng Wu, Cheng Zhang, Guihao Yan, Xifeng Hu, Zhi Liu, Qing Cai
任务设定
面向自主具身超声扫描的探头运动控制
痛点动机
力觉与超声图像弱耦合,缺乏扫描阶段感知
解决方案
提出力-超声融合模块,结合阶段自适应调制机制
41
Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa
任务设定
长时程机器人操作中的 3D 场景记忆构建
痛点动机
现有 3D 记忆被动记录,未区分任务相关性
解决方案
以 3D 高斯泼溅 为几何记忆载体,端到端学习记忆更新策略
42
Chengyan Wang, Hanliang Xie, Yueyi Yang, Haoyu Chen
任务设定
零样本微手势识别,用多模态大模型判断细微手势
痛点动机
MLLM 对短促、局部的微手势运动线索不敏感易忽略
解决方案
用树搜索逐步定位细粒度视觉证据,配合测试时校准修正分数偏差
43
Yanyan Zhang, Disheng Liu, Kai Ye, Chaoda Song, Xinpeng Li, Mohsen Hariri, Vikash Singh, Yu Yin, Vipin Chaudhary
任务设定
VLA 机器人操作在线中断后的故障恢复
痛点动机
现有恢复方法需失败数据或策略重训练,存在执行风险
解决方案
推理时通过反事实想象延续目标轨迹,再最小化调整机器人与场景以重新对齐,无需微调
44
Liang Hong, Jiaxin Wei, Simon Schaefer, Stefan Leutenegger, Jaehyung Jung
任务设定
机器人在光照不均暗环境下的可重光照 3D 重建
痛点动机
2D 图像增强缺乏可靠监督,破坏多视角几何一致性
解决方案
扩展 3D Gaussian Splatting ,联合优化光照参数,结合球谐光照模型与 BRDF 反射建模