1
Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai
任务设定
端到端自动驾驶中的世界动作模型规划
痛点动机
现有 WAM 推理时需生成未来帧,成本高昂
解决方案
仅将视频生成用作训练信号,与轻量动作专家联合训练,推理时舍弃视频分支直接出轨迹
2
An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian
任务设定
统一图像级与视频级的世界模型表征学习
痛点动机
现有 JEPA 方法各自割裂,难以统一图像/视频建模
解决方案
共享隐空间联合学习光度与时序预测,支持动作条件下的零样本规划
3
Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep
任务设定
解决视频世界模型长程生成的记忆检索问题
痛点动机
超出训练时长后 RoPE 位置编码失效,记忆无法被检索
解决方案
提出 WorldTrace 免训练框架,给压缩记忆分配可寻址虚拟位置
4
Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell
任务设定
分析驾驶 VLA 模型中规划 token 的层级表征
痛点动机
不清楚动作生成究竟需要多深的语言模型
解决方案
用轨迹空间 logit lens 逐层解码规划 token ,剪枝 8/32 层仅增约 5%误差
5
Ziheng Liu, Quantao Yang
任务设定
用强化学习对 VLA 模型做后训练以适配机器人操作
痛点动机
现有 RL 方法统一更新各模块,忽略了语义与动作的不同角色
解决方案
冻结视觉语言骨干,语义投影层与动作专家采用双时间尺度分别更新
6
Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li
任务设定
连续视觉语言导航( VLN )中构建世界导航模型
痛点动机
现有方法未将未来观测和动作生成建立在 3D 场景几何表示上
解决方案
先用几何编码器提取历史观测的 3D 特征转成 token 前缀,条件化扩散模型生成未来视频与动作
7
Yang Shen, Chonghao Cheng, Ziyi Zhao, Jialuo Zhu, Zhenyi Yi, Qi Zhao, Jian Yang, Yuhui Shi, Chin-Teng Lin
任务设定
面向实验室任务的双臂移动操作机器人原型
痛点动机
语言指令到安全动作的可靠对齐仍是难题
解决方案
提出表征交接机制,将指令约束为技能调用,感知锚定物体位姿并编译为可执行动作
8
Minchao Jiang, Xiaoxuan Ma, Shunyu Jia, Haoru Wang, Zhang Liang, Wentao Zhu
任务设定
无位姿多视角图像的前馈 3D 重建与实例理解
痛点动机
现有方法多逐场景优化,重建与语义割裂
解决方案
提出 InstanceSplat 统一前馈 3DGS 框架,联合建模外观、几何、实例与语义
9
Zehui Li, Zihao Sun, Jiawei Xu, Zheqi He, Xiaoqiang Zhang, Jing-Shu Zheng, Lu Liu, Dahui Gao, Xiuwan Chen
任务设定
未知多楼层室内环境中的连续多目标导航任务
痛点动机
以往方法割裂处理多目标记忆与跨楼层导航能力
解决方案
维护持久化 3D 语义体素记忆,结合楼梯感知实现统一跨楼层导航策略
10
Jinhe Tang, Weiming Zhi
任务设定
动作分块模仿学习策略部署中的人机控制切换
痛点动机
策略偏离示教分布时仍输出平滑但错误的动作
解决方案
用视觉-动作支持记忆评估动作块,双向校准阈值自动切换策略与操作员控制
11
Jie Ren, Zhehao Jiang, Yinhong Yang, Haorui Jia, Han Jiang, Ben Li, Yao Yao, Cheng Lin, Qiu Shen, Zhenshan Bing, Xiao-Xiao Long, Xun Cao
任务设定
从单目视频重建并迁移灵巧手操作演示
痛点动机
单目重建接触不稳定,跨手型迁移难保接触几何
解决方案
在规范物体空间聚合稳定接触,结合拉普拉斯优化和残差 RL 迁移到灵巧手
12
Kai Li, Lutao Jiang, Zhenyang Li, Jiayu Dong, Jierui Zhang, Yingda Yin, Runze Zhang, Kai Yan, Xiaoyang Huang, Keyang Luo, Xin Wang, Xiangyu Zhao, Weikai Chen
任务设定
稀疏视角下重建可编辑的 3D 室内场景
痛点动机
现有方法依赖密集视角或人工标注先验,难以泛化
解决方案
预测可执行场景程序,通过感知驱动的资产实例化和闭环空间优化重建场景
13
Xiangkai Ma, Yue Ma, Junjie Wang, Sheng Xu, Mingyang Li, Han Zhang, Yuzheng Zhuang, Wenzhong Li, Zhihao Yuan
任务设定
统一建模世界状态演化与机器人动作生成
痛点动机
现有方法视觉与动作分支表征纠缠,监督信号稀疏
解决方案
提出 PILOT 框架,用状态转移 CoT 显式解耦高层语义与底层轨迹
14
Shuai Fang, Xin Deng, Yuchen Kang, Zhenjiang Li, Jie Chen
任务设定
机器人第一视角场景的稀疏采集 real-to-sim 重建
痛点动机
密集多视角采集成本高,稀疏采集难覆盖机器人行为视角
解决方案
用双代理(机器人代理+几何代理)生成伪观测精修场景资产,在 Unitree G1 人形机器人上验证坐下策略成功率大幅提升。
15
Haodong Yan, Jiaguan Zhu, Mingyuan Jia, Ruiqing Yin, Junjie He, Zhide Zhong, Junfeng Li, Jinxuan Lu, Hengtao Li, Tianran Zhang, Jiayi Chen, Wenxuan Song, Wen Chen, Yuxiang Gao, Haoang Li
任务设定
让 JEPA 世界模型的潜变量对应机器人物理状态
痛点动机
纯前向预测无法保证潜空间可辨识状态,限制规划与策略
解决方案
用本体感知状态和多步关节角变化做双重接地监督,仅训练期使用不增加推理成本
16
Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren
任务设定
构建可控的手术世界模型,生成器械-组织交互视频
痛点动机
多模态条件直接融合易导致解剖畸变和时序不一致
解决方案
用层级手术锚点保持场景一致性,多模态控制专家分阶段融合驱动视频扩散模型
17
Ying Chen, Weizhen Li, Zhe Hu, Zhenjiang Li, Rui Jiang, Zhifeng Gu, Lihuang Fang, Jiangping Liu, Lei Yi, Jie Chen
任务设定
构建面向具身智能的执行中心视觉语言模型
痛点动机
现有方法按任务孤立训练能力,难以支撑迭代执行闭环
解决方案
按空间推理、时序理解、动作指导、状态验证四类分别强化学习训练专家,再权重合并+蒸馏统一
18
Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu
任务设定
单腕相机下长时程、部分可观测的 VLA 机器人操作
痛点动机
物体出视野后感知遗忘,多步任务中进度也会遗忘
解决方案
提出双记忆架构( 4D 世界状态记忆+自我状态记忆),条件化扩散 Transformer 做主动空间推理
19
Jiazhuo Li, Yiming Fei, Zhiruo Zhou, Heikichi Hayashi
任务设定
含不可控干扰运动场景下的世界模型动作预测
痛点动机
干扰运动会让世界模型对动作预测'失明',不同动作预测变得难以区分
解决方案
借鉴 dueling 价值分解,减去动作预测的均值效应,分离出纯净的可控动作通道
20
SM Mazharul Islam, Manfred Huber
任务设定
视觉控制任务中的 世界模型 表征学习
痛点动机
全图重建使潜在表征被 无关背景 稀释
解决方案
用 随机空间注意力 聚焦任务相关区域,仅重建该区域并辅以逆动力学目标
21
Riccardo Curcio, Hongpeng Cao, Marco Caccamo
任务设定
Sim-to-real 策略学习的安全性验证
痛点动机
仿真训练的控制器难保证真实世界中安全鲁棒
解决方案
结合 Lyapunov 稳定性分析 与 进化优化 及统计模型检验,迭代扩展可验证安全区域
22
Ziyue Zheng, Linli Shi, Bingkun He, Wen Jiang, Ziyun Wang
任务设定
基于 高斯泼溅 的主动 3D 场景重建规划
痛点动机
贪心式次优视角选择导致重建轨迹效率低
解决方案
建模为 遍历覆盖问题,用核遍历轨迹规划器匹配全局信息分布