1
Matteo Merler, Giovanni Bonetta, Davide Zago, Rossella Cancelliere, Bernardo Magnini
任务设定
利用 VLM 教师辅助训练自主强化学习策略
痛点动机
VLM 每步查询成本高,直接当策略又无法自我提升
解决方案
仅在策略不确定时查询 VLM ,按环境优势加权蒸馏其建议到轻量 RL 策略
2
Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin
任务设定
把大型视频生成模型改造成交互式世界模型
痛点动机
现有语言控制粗糙,缺乏精确的时序动作控制能力
解决方案
用时序注意力路由对齐角色/相机指令与视频片段,仅需轻量 LoRA 微调
3
Sharon S. Musa, Fereshteh Forghani, Harrish Thasarathan, Sonia Joseph, Matthew Kowal, Konstantinos G. Derpanis
任务设定
探究视频基础模型内部表征编码了哪些时空概念
痛点动机
尚不清楚视频模型各层学到了什么、如何几何组织
解决方案
用轻量探针分析 V-JEPA 2 等模型对相机运动/物理/异常的编码,并做样条式表征引导
4
Jaewoo Park, Minyoung Lee, Sukmin Seo, Moonbin Yim, Hyunwook Yoon, Dohoon Ryu, Daehee Kim, Myungseo Song, Jihyuk Byun, Seunggyu Chang, Taeho Kil, Jiseob Kim, Bado Lee, Geewook Kim
任务设定
评测多模态大模型作为无人机视觉-语言-动作智能体的能力
痛点动机
现有系统过度限制模型决策空间,具身能力未被充分检验
解决方案
提出 DroneCATS-Agent 架构与基准,在接近、跟踪、搜索、编队指挥等任务中测试模型自主决策
5
Wei Wang, Wenqiao Zhang, Yutong Lin, Yuqian Yuan, Tianwei Lin, Jinhao Mao, Zhenxuan Fan, Mingjian Gao, Yang Dai, Wentong Li, Zheqi Lv, Zheng Dong, Yingjie Niu, Jiaqi Zhu, Jun Xiao, Chao Li, Yueting Zhuang
任务设定
统一编排、训练与部署 VLA 机器人智能体
痛点动机
长时程任务需感知规划执行验证协同,非仅动作预测
解决方案
将技能决策视为执行提案,运行时校验前提并验证结果,用 Qwen3-VL+pi0.5 实例化
6
Kai Guan, Minchao Jiang, Ruichen WangLi, Wentao Zhu, Lei Zhang
任务设定
从第一视角视频联合重建场景与佩戴者全身运动
痛点动机
场景重建忽略人体,运动估计又缺场景几何且依赖外部轨迹
解决方案
几何基础模型估计相机与场景,条件扩散模型生成人体运动,再闭环运动学精修
7
Riyaaz Shaik, Chandru Venkataraman
任务设定
让 VLA 模型从演示中学习可复用的运动技能库
痛点动机
现有 VLA 模型是整体式输出动作,长时程任务表现差且难解释
解决方案
用世界模型结合行为等价核聚类运动片段,生成类型化 lambda 程序驱动动作解码器
8
Jiayu Ding, Zhuodong Liu, Lei Zhang, Manyu Xiong, Hongbo Jin, Haoran Tang, Hongbo Zhang, Changen Zhu, Wenbo Xing
任务设定
评估 VLM 在动态 3D 场景中的自运动感知能力
痛点动机
大位移下空间推理严重退化,模型只学到平滑轨迹先验
解决方案
提出反事实渲染基准 Dyn-3D ,并用 TempoVista 框架把物理真值嵌入策略优化训练
9
Cuong Le, Bao-Long Tran, Pavlo Melnyk, Tahereh Dehdarirad, Bastian Wandt, Mårten Wadenbäck
任务设定
单张图像的概率性 3D 人体网格恢复
痛点动机
深度信息缺失导致姿态存在多解歧义, SMPL 旋转空间难建模
解决方案
提出四元数约束连续归一化流,基于 2D 姿态生成多个合理 3D 姿态假设
10
Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang
任务设定
基于 LLM 的视觉语言导航( VLN )任务
痛点动机
逐步自回归推理导致决策延迟累积,难以实时导航
解决方案
提出 Verifier-First 框架,用批量动作验证替代自回归生成,仅对不确定情况调用生成器,延迟降低 10 倍以上
11
Linhao Zheng, Zeming Liu, Wangke Chen, Li Zeng, Wanxiang Che, Heyan Huang, Yuhang Guo
任务设定
评测 VLM 能否无手册探索操作家用设备
痛点动机
现有具身探索依赖模仿学习,泛化能力差
解决方案
提出 VGEBench 基准,用状态机模拟多轮交互测试视觉 grounding 能力
12
Sangmin Song, Sarath Kodagoda, Marc G. Carmichael, Karthick Thiyagarajan, Amal Gunatilake, Kelly Prentice, Jodi Martin
任务设定
从 RGB-D 或单目视频构建开放词汇 3D 实例地图
痛点动机
在线 SLAM 系统常在证据不足时过早提交实例标签
解决方案
提出免训练的体素级实例管理器,延迟标签判定直到多视角证据充分累积
13
Yuanwang Yang, Buzhen Huang, Zongxuan Ren, Jing Huang, Kun Li
任务设定
无约束场景下的多视角多人 3D 人体重建
痛点动机
传统自下而上方法依赖精确标定和跨视角匹配,遮挡下易失败
解决方案
构建统一的实例中心 3D 空间,用对比学习联合标定、匹配与重建,前馈回归 SMPL 参数
14
Xiaoyan Liu, Jiaxin Liu, Kangrui Li, Sifan Zhou
任务设定
面向实时交互的 4D 世界模型生成任务
痛点动机
传统方法视频生成与 3D 重建串行执行,导致交互延迟高
解决方案
提出 Streaming4D ,将分块自回归视频生成与增量式 3D 重建并行执行,边生成边重建以降低延迟
15
Geonho Kim, SooGon Kim, Jongmin Lee
任务设定
研究带否定约束的语言驱动灵巧抓取(哪里不能抓)
痛点动机
训练数据几乎没有避让指令,模型易把禁止部位误当抓取目标
解决方案
推理阶段用序列蒙特卡洛结合无分类器引导采样,避开禁止区域,无需额外训练数据
16
Vida Adeli, Soroush Mehraban, Jacob Rommann, Harrison Sanborn, Cole Clifford, Babak Taati
任务设定
生成与语音同步、感知物体的协同手势动作
痛点动机
现有语音驱动手势方法忽略姿态约束与物体空间关系
解决方案
用因果隐空间扩散模型编码手势基元,结合姿态和物体几何条件生成手势
17
Xionghao Wu, Yijun Yang, Shiyang Zhou, Haoze Sun, Jianhui Liu, Songsong Yu, Jiyao Zhang, Wenbo Li, Bo Wang, Guoqing Ma, Lin Song, Renjie Liao, Shenghe Zheng, Wei Tang, Xiaojuan Qi, Yanwei Li, Yuan Zhang, Zhuotao Tian, Haoyang Huang, Nan Duan
任务设定
从大规模第一视角视频中学习可泛化的世界动作模型做机器人操控
痛点动机
带动作标签的机器人轨迹数据稀缺昂贵,难以覆盖多样场景
解决方案
三阶段课程训练+慢快双系统架构,把视频动力学迁移到目标机器人,实现 30 Hz 实时控制
18
Rongze Tang, Jianjie Fang, Zhaolu Wang, Ziyou Wang, Xvyuan Liu, Haisheng Su, Xin Zhang, Wei Wu, Chen Gao, Yong Li, Zhibo Chen
任务设定
训练能建模物体交互的动作条件世界模型
痛点动机
MSE 去噪目标下静态内容主导,交互区域监督不足
解决方案
用跨注意力构建交互图,据此重新加权去噪监督