1
Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa
任务设定
大规模 RL 预训练+后训练实现高自由度灵巧手仿真到真实迁移
痛点动机
多指机器人长时程任务难以从零学习,重复训练效率低
解决方案
先在通用重摆姿任务预训练灵巧策略作为先验,再用行为克隆蒸馏、critic 预热和保守更新稳定后训练迁移
2
Ruiguo Zhong, Benshan Ma, Xiaolong Chen, Lang Zhang, Mingyue Feng, Yaonong Wang, Pei Liu, Jun Ma
任务设定
统一自动驾驶中未来场景预测与轨迹决策打分
痛点动机
现有世界模型预测与规划解耦,未体现动作专属后果
解决方案
为每条候选轨迹生成独立的动作条件未来隐状态,再用打分器评估并监督训练
3
Yechan Park, HyunJin Kim
任务设定
让冻结的 VLA 机器人策略适应部署相机视角偏移
痛点动机
相机位置微小偏移就使成功率从 90% 降到 10%,重训练代价高
解决方案
用 3D 高斯溅射做新视角合成,插在策略前做视角规范化,无需改动策略权重
4
Yumin Lee, Hyoseok Ju, Giseop Kim
任务设定
机器人在长期多次重访场景中持续追踪物体历史状态
痛点动机
现有系统易出现'时间失忆',无法回答物体跨会话变化的查询
解决方案
提出易变性感知的时空记忆框架,用三层记忆结构支持长期物体级推理
5
Álvaro G. Iñesta, Mattia Ryffel, Amit H. Bermano, Robert W. Sumner, Martin Guay
任务设定
从音频生成精确的鼓手打击动作
痛点动机
打击动作需要高加速度与厘米级精度,现有方法难以泛化到真实音频
解决方案
用扩散模型结合双目标损失,解耦骨骼自然性与鼓槌打击精度
6
Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie, Ran Yi
任务设定
为具身智能生成可执行的 3D 场景代码
痛点动机
现有场景生成仅关注摆放和关节,缺少功能可用性建模
解决方案
提出 RoomWright ,以任务为中心做物体功能推理,并用代码规则表达多物体交互逻辑
7
Chenglin Liu, Xun Wang, Ruishuo Chen, Zhuoran Li, Longbo Huang
任务设定
用 LLM 自动设计强化学习的奖励函数
痛点动机
现有方法把奖励当整体程序生成,难以复用已验证的有效模块
解决方案
提出模块化奖励池,通过反思优化、混合信用分配和合并回滚机制持续演化奖励组件
8
Jiawei Wang, Ke Rui, Yushen Zuo, Yichun Feng, Minglei Li
任务设定
评估潜在世界模型用于 MPC 规划时的决策对齐问题
痛点动机
潜在距离排序未必符合真实任务进度
解决方案
提出 Plan-Real Spearman 等排序一致性指标,并用逆动力学目标改进 LeWM 模型
9
Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo
任务设定
面向动态场景的 4D 视觉-语言联合表征学习
痛点动机
现有编码器缺乏同时建模空间结构与运动演化的能力
解决方案
提出 CL4D 对比学习对齐 4D 动态点云与文本,构建 4DVLM 实现零样本运动-文本检索
10
Berken Utku Demirel, Christian Holz
任务设定
从第一视角头显摄像头估计心率变异性( HRV )
痛点动机
运动和噪声掩盖了注视视频中的细微心跳信号
解决方案
用 3D 主干网络 + 高低频分解模块提取血容量脉搏信号,跨域预训练对齐信号频域表示
11
Yunhe Li, Likun Wu, Sijing Wu, Xinyu Tian, Huiyu Duan, Yixuan Gao, Yunhao Li, Guangtao Zhai
任务设定
面向相机可控世界视频生成的感知质量评估基准
痛点动机
现有视频质量评估方法无法捕捉视角一致性等生成特性
解决方案
构建 CamWorldQA 基准,并提出多分支网络 CWQA 融合空间、时序与光流特征预测质量分数
12
Mohammad Zamani, Fatemeh Ziaeetabar
任务设定
综述面向第一人称视频理解的视觉语言模型研究
痛点动机
自运动、遮挡、小物体等使自我中心视觉理解困难
解决方案
系统梳理 VLM 在任务、数据集、手物交互及具身智能中的应用与局限
13
Yansong Wang, Zhaobo Qi, Xinyan Liu, Beichen Zhang, Shuhui Wang, Weigang Zhang, Qingming Huang
任务设定
具身交互场景中物体动力学建模与运动轨迹预测
痛点动机
现有方法压缩为稀疏关键点,丢失细节导致轨迹漂移
解决方案
基于 3D 高斯粒子图,结合时序解耦网络与图 Transformer 建模多尺度时空交互
14
Pardis Taghavi, Reza Langari, Gaurav Pandey
任务设定
视频生成与世界模型中的免训练稀疏注意力加速
痛点动机
现有稀疏注意力方法未指定可执行算子,误差难以控制
解决方案
提出 SparsePR :响应耦合分区+探针拟合残差重建,降误差并提速 1.5-2.6 倍
15
Jiaming Fan, Jian Lu, Jinling Jia, Chenbin Zhang
任务设定
从单目视频重建动态 4D 场景
痛点动机
如何保证 4D 高斯参数在非欧流形上的中间状态合法
解决方案
提出黎曼流匹配,直接在 4D 高斯的尺度、旋转等流形上建模概率路径
16
Qian Yin, Ruiping Liu, Kunyu Peng, Jianxiang Man, Isik Baran Sandan, Junwei Zheng, Yufan Chen, Di Wen, Kailun Yang, Rainer Stiefelhagen
任务设定
协调导盲犬与取物机器狗并行完成导航取物任务
痛点动机
LLM 生成计划可能违反机身约束,动作看似成功也未必真完成
解决方案
LLM 生成日程化四动作方案,执行前校验目标可行性,实现并行调度降低耗时
17
Ziyang Cheng, Tianshu Tang, Jinxin Lan, Xinze Chen, Yuhan Gong, Zhichao Liu, Changzhong Wu, Yahao Mao, Zongyan Deng, Mingxuan Ma, Huasen Xi, Yilong Liu, Yutong Wu, Xiaofeng Wang, Yang Wang, Yun Ye, Guan Huang, Xiaojie Jin, Zheng Zhu, Jiwen Lu
任务设定
人形机器人全身控制需应对地形与物体接触
痛点动机
现有策略仅在空场景训练,无法建模环境交互
解决方案
提出行为世界模型,用因果 Transformer 联合预测动作、状态与行为分布,在线纠正不可行指令
18
Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo
任务设定
基础模型时代以人为中心的智能研究综述
痛点动机
相关研究在任务、模态和社区间割裂,缺乏统一框架
解决方案
提出涵盖外观、动力学与具身智能体的六层级人类语境分类体系,系统梳理方法与数据集