1
Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang
任务设定
增强视觉语言模型的 3D 空间理解与推理能力
痛点动机
现有 VLM 仅靠 2D 输入,难以处理精细 3D 任务
解决方案
从 RGB 视频学习隐式与显式几何 token ,融合 2D 视觉线索注入 3D 先验
2
Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou
任务设定
多智能体交互式世界模型的流式视频生成
痛点动机
自回归视频扩散难以维持跨智能体共享的世界状态
解决方案
引入世界状态寄存器存储共享信息,用混合 Transformer 分离状态与画面建模
3
Yihong Sun, Seoung Wug Oh, Jiahui Huang, Bharath Hariharan, Joon-Young Lee
任务设定
统一预测 8 种密集场景属性的视频模型
痛点动机
各任务标注分散在不兼容数据集,联合训练成本高
解决方案
借助扩散模型先验,用任务专家蒸馏出统一骨干,无需标注重叠
4
Yu Qi, Zhang Ye, Xinyi Xu, Yuxuan Lu, Amitoj Sandhu, Boce Hu, Haojie Huang, Jonathan Tremblay, Lawson L. S. Wong
任务设定
诊断机器人操作策略对指令因子的捷径依赖
痛点动机
策略常走捷径,依赖颜色等显著线索而非真正理解语言
解决方案
提出指令因子偏差诊断框架,定向采集数据提升泛化与样本效率
5
Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan
任务设定
从自然语言生成可控、物理真实的 4D 动态世界
痛点动机
现有生成模型难以保证物理合理性与可控性
解决方案
多智能体框架接入物理引擎,分工完成资产、材质、运动与渲染配置
6
Yukun Shi, Minglun Gong
任务设定
评测观测窗口外动态场景的未来表面重建能力
痛点动机
现有动态重建只评估观测区间内,缺少面向 AR/机器人的未来预测基准
解决方案
构建 FutureSurf 基准,用 Chamfer 距离量化未来表面重建误差
7
Quanfu Yu, Xian Wu, Hao Xu, Liulong Ma
任务设定
自动驾驶中融合世界模型的 VLA 轨迹生成
痛点动机
像素级预测鲁棒性差,纯隐空间预测缺乏可解释性
解决方案
提出混合世界模型:预训练阶段同时做隐空间预测与像素重建,微调阶段仅用隐空间特征驱动动作专家出轨迹
8
Yingdong Hu, Yisheng He, Yiming Jiang, Zehong Lin, Steven Hoi, Jun Zhang
任务设定
单张图像一次性生成可动画的 4D 高斯头部化身
痛点动机
现有方法注意力激活含噪声,且重建与动画目标相冲突
解决方案
提出对称语义注意力正则化,并用双阶段训练分离重建与动画能力
9
Junhao Chen, Xinghao Chen, Henghaofan Zhang, Zihao Qiao, Saining Zhang, Yongzhi Li, Ruqi Huang, Sisi Li, Yimin Sheng, Jianyi Zhu, Hao Zhao
任务设定
单图重建可编辑的 3D 场景(物体+光照)
痛点动机
现有方法止步于房间几何,光照烘焙难以编辑
解决方案
构建 Lumera 基准与管线,用 VLM 解析物体框和参数化光源并重建网格
10
Arjun Majumdar, Avinash Sooriyarachchi, Benjamin Tibi, Chris Bamford, Elliot Chane-Sane, Guillaume Lample, Khyathi Raghavi Chandu, Ludovic Ho Fuh, Mathieu Poiree, Olivier Duchenne, Rosalie Millner, Srijan Mishra, Theo Cachet, Thomas Chabal
任务设定
仅用单目 RGB 实现跨机器人本体的导航
痛点动机
依赖深度相机/多目/地图导致部署成本高
解决方案
8B 视觉语言模型在图像空间预测路点,模拟数据+前缀缓存训练提速 22 倍
11
Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss, Chirayu Nimonkar, Ishaan Javali
任务设定
端到端学习可组合的机器人操作策略
痛点动机
无预定义任务分解,如何自动获得可复用技能
解决方案
MoE 动作头使专家涌现为可复用行为基元,路由隐式完成高层任务排序
12
Miroslav Krupa, Miroslav Cibula, Kristína Malinovská
任务设定
学习式机器人避障轨迹规划
痛点动机
采样法算力开销大,学习法样本效率低、泛化差
解决方案
用正向-逆向模型做自监督信号训练规划器,发现并缓解其“钻学习信号空子”问题
13
Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan
任务设定
预测机器人操控下可变形物体的动力学演化
痛点动机
逐物体拟合材料参数慢且难泛化,纯学习模型外推差
解决方案
结合可微 MPM 模拟器与两个前馈网络:从视觉推断材料弹性,并学习残差修正弥补模拟偏差