1
Anqi Li, Yuxin Chen, Zhaobo Li, Zhuo Cao, Junli Ren, Masayoshi Tomizuka, Dhruv Shah
任务设定
杂乱室内环境中人形机器人的全身导航
痛点动机
2D 路径规划难以应对全身级避障与协调运动
解决方案
提出全身视觉-语言-动作模型 TANGO ,仿真合成数据训练后零样本部署到真实 G1 机器人
2
Yuncong Yang, Zhengtao Han, Furkan Ozyurt, Zeyuan Yang, Han Yang, Junyi Cao, Haoyu Zhen, Yilun Du, Chuang Gan
任务设定
让世界模型成为跨环境零样本机器人仿真器
痛点动机
同一数值动作在不同视觉环境下表现各异,泛化差
解决方案
用视觉标定片段建立动作-视觉映射,实现无需额外训练的新环境泛化
3
Minsik Jeon, Jay Karhade, Deva Ramanan, Shubham Tulsiani
任务设定
长视频序列的 4D 重建与逐点长程运动跟踪
痛点动机
现有 4D 方法仅支持几十帧短窗口,长视频易失效
解决方案
提出 3D 查询式运动解码器,解耦轨迹预测与可见性,实现数百帧长程跟踪
4
Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang
任务设定
接触丰富场景下灵巧操作的视觉-语言-动作建模
痛点动机
视觉遮挡与复杂接触动力学让现有 VLA 模型难以应对
解决方案
提出 DeCAL ,通过自适应视触觉融合门控和视触觉潜在共想象建模物理动态
5
Thodoris Betsas, Anastasios Doulamis, Andreas Georgopoulos
任务设定
无需标注的开放词汇 3D 场景理解与分割
痛点动机
CLIP 特征直接提到 3D 空间易出现词袋式语义偏差
解决方案
用视觉语言模型生成结构化文本描述,直接聚合到纯语言嵌入空间,无需 3D 训练语料
6
Hongchi Xia, Tianhang Cheng, Wei-Chiu Ma, Shenlong Wang
任务设定
从单张 RGB 图像/视频秒级重建可交互 3D 场景
痛点动机
现有方法耗时优化,物体难以物理解耦以供交互
解决方案
前馈网络直接预测每个物体的位姿、网格与纹理,一分钟内生成仿真就绪场景
7
Bishnu Dev, Vasco Xu, Xi-Aan Loh, Chenfeng Gao, Henry Hoffmann, Karan Ahuja
任务设定
仅用单个智能手表 IMU 实时估计手臂姿态
痛点动机
传统方法依赖校准姿势,易受漂移和误差影响
解决方案
在手表原生传感器坐标系下直接训练,免校准且适配不同佩戴方式
8
Rx Fan, Zhan H
任务设定
多智能体交通场景的长时域闭环仿真世界模型
痛点动机
长时域生成难以兼顾多时间尺度的一致性与适应性
解决方案
提出分层状态反馈框架,用目标多时间尺度分支逐级反馈生成状态
9
Tinghe Ding, Jiahao Li, He Wang
任务设定
多阶段机器人操作任务的策略学习
痛点动机
动作块跨多个阶段,但标签仅描述首步,语义粗糙
解决方案
用 VLM 切分演示阶段,蒸馏动作块级语义目标指导策略训练
10
Qiaohui Chu, Haoyu Zhang, Meng Liu, Haoxiang Shi, Dongmei Jiang, Liqiang Nie
任务设定
从第一视角视频预测未来交互位置与全身动作
痛点动机
语义理解难转化为精确 3D 定位,且动作多样性与结构一致性难兼顾
解决方案
提出 HIGFlow 级联框架,先定位交互点,再用残差流匹配生成全身动作
11
Minqiang Zou, Riqiang Jin, Zhi Lv, Dong Luo, Lianghai Tian, Zhenyu Zhao, Qi Xu, Tong Wu, Mochen Yu, Yao Tang
任务设定
从自我中心双目视角估计手-物交互场
痛点动机
需同时兼顾全局场景语境与局部精细手物证据
解决方案
融合 DINOv3 全局特征、局部采样证据与 Plücker 射线几何联合解码
12
Tianyi Ma, Parisa Kordjamshidi
任务设定
具身规划中让 VLM 生成可执行动作序列
痛点动机
VLM 计划常引用未观测物体或违反动作约束,导致不可执行
解决方案
用场景证据构造解码时约束,结合 HMM 世界状态前瞻剔除不可行候选
13
Feiyu Zhao, Yuetong Li, Chenxi Xiao
任务设定
主动重定向实现机器人手持物体的 3D 重建
痛点动机
机器人抓握时视觉遮挡严重,物体表面难以完整观测
解决方案
用 Ray-GPIS 沿视线估计各方向重建不确定性,据此规划手内旋转动作暴露未观测区域,并结合无 CAD 的位姿跟踪融合 RGB-D 数据渐进重建
14
Yiran Wang, Zeyu Zhang, Ling Shao, Hao Tang
任务设定
文本驱动的人体动作生成( T2M )任务
痛点动机
检索证据与生成器隐空间存在语义鸿沟,检索粒度粗糙
解决方案
在生成器预量化隐空间内重建检索库,蒸馏投影器对齐文本查询
15
Nhat-Tan Bui, Varshini Elangovan, Arun Reddy Anugu, Sreyas Mohan, Wei Ye, Dilin Wang, JQ Huang, Rakesh Ranjan, Aviral Chharia, Fernando De la Torre
任务设定
多视图 3D 场景推理下的视觉 token 剪枝任务
痛点动机
现有剪枝方法丢失空间覆盖,导致 3D 推理性能下降
解决方案
提出 CoVeR ,按坐标选覆盖全场景的 token ,训练无关且预算可控
16
Kevin Chuanpu Fu, Yongsen Zheng, Zee Kin Yeong, Kwok-Yan Lam
任务设定
融合法律证据重建犯罪现场并生成再现视频
痛点动机
原始证据直接喂世界模型会丢信息、动作违背记录
解决方案
用智能体编排世界模型,融合证据生成可追溯叙事并做物理验证
17
Jingxuan Zhu, Jingyi Li, LiangLiang Chen, Zhiyuan Jing, Jidong Zhang, Hongming Li
任务设定
双臂机器人操作的仿真数据生成平台
痛点动机
真实采集昂贵,现有仿真资产库难以扩展新物体场景
解决方案
将用户观测自动转为仿真资产,构建数字孪生变体生成专家轨迹
18
Aryan Singh, Chandan Biswas
任务设定
无需穿戴设备的帕金森步态冻结检测
痛点动机
转身时骨骼关键点易被自遮挡,视觉检测精度下降
解决方案
用 IMU 数据蒸馏引导视觉模型,跨模态对齐提升遮挡下检测精度
19
Pardis Taghavi, Tingyu Guo, Jonas Lossner, Gaurav Pandey, Reza Langari
任务设定
交互式视频世界模型推理中实时切换动作条件
痛点动机
换动作需等待下一 chunk 或触发昂贵的回滚重算
解决方案
提出反事实状态迁移,用轻量校正器把中断状态迁移到新动作对应状态,冻结模型且无需重算已完成步骤
20
Ziqin Huang, Yingyue Li, Chenyangguang Zhang, Ruida Zhang, Yuxin Chen, Gu Wang, Xingyu Liu, Masayoshi Tomizuka, Xiangyang Ji
任务设定
让 VLM 为机器人操作预测 3D 一致路径点
痛点动机
2D 图像空间轨迹存在深度歧义,限制 3D 空间推理
解决方案
先生成多视角一致的 2D 路径点,再通过几何三角化得到 3D 路径点,保留预训练 VLM 先验
21
Chi Wan, Kangrui Wang, Yuan Si, Pingyue Zhang, Manling Li
任务设定
让 VLA 模型在部署时适应新环境动态变化
痛点动机
现有方法只做静态预训练,无法应对环境动态偏移
解决方案
共享 Transformer 双头联合预测状态与动作,用测试时训练在线更新世界模型
22
Suyog Khanal, Arun Kumar A, Santu Rana
任务设定
交互式模仿学习中自动决定该请求怎样的示教
痛点动机
以往方法只判断何时打断,示教内容仍随意选取
解决方案
按几何特征将失败聚类成失效模式,用 VLM/LLM 生成针对性示教请求
23
Yuhang Wang, Chuheng Wei, Jingxin Yang, Xishun Liao, Hao Zhou
任务设定
预测车内驾驶员的连续身体运动
痛点动机
现有数据集多为短片段分类,缺乏连续运动预测基准
解决方案
构建 393 小时多源数据集,提出动态锚定评估聚焦机动前后关键动作
24
Soroush Mehraban, Xin Lei Lin, Vida Adeli, Majid Mirmehdi, Amirhossein Dadashzadeh, Clint Hansen, Andrea Iaboni, Babak Taati
任务设定
从单目视频估计临床步态参数
痛点动机
真实步态数据规模小、视角单一,限制模型泛化
解决方案
用 SMPL 驱动合成 19272 段步态视频,训练 GaitXFormer 等模型
25
Kai Weixian Lan, Bodie Criswell, Briana Fedkiw, Zhan Zhang, Joseph Teran, Daniel Holden
任务设定
根据文本和风格参考生成人体运动
痛点动机
文本难以描述动作的细粒度风格,如节奏与力度
解决方案
联合训练风格编码器与文本到运动扩散模型,支持长时多风格生成
26
Kacper Mroczek, Michal Kepski
任务设定
研究人体姿态估计与关键点动作识别的黑盒对抗攻击
痛点动机
传统边界框式反馈无法衡量关键点姿态的退化程度
解决方案
提出 OKS Attack ,以目标关键点相似度作为反馈信号,直接攻击姿态关键点空间结构
27
Yuhan Wang, Yurou Chen, Hongye Jiang, Wenzhao Lian
任务设定
接触式装配任务的零样本仿真到真实迁移
痛点动机
视觉与力/力矩测量存在仿真-真实差距,策略难迁移
解决方案
提出 PACE 编码器,用本体感觉监督视觉和力矩表征,抑制域相关噪声
28
Hongxiang Zhao, Mutian Xu, Zeyu Jin, Yiming Hao, Shuguang Cui, Xiaoguang Han
任务设定
把人手复杂空间抓取动作迁移到机器人 夹爪
痛点动机
现有方法难以处理旋转、翻转等复杂空间轨迹
解决方案
构建大规模手-夹爪配对数据集,两阶段框架先预测关键帧再生成连续动作序列
29
Keqi Chen, Vinkle Srivastav, Nicolas Padoy
任务设定
多视角图像自监督估计 3D 注视目标 位置
痛点动机
现有方法只能估计 2D 注视点且依赖真实场景标注
解决方案
用 3D 注视向量 构建光线锥,概率光线投射 估计空间似然分布
30
Raphael Lorenzo-Louis, Bertrand Luvison, Serena Ivaldi
任务设定
从姿态/视频预测人是否想与服务机器人互动
痛点动机
人机交互意图预测对社交机器人而言仍很具挑战性
解决方案
对比人类标注者、轻量姿态模型与视觉语言模型在 HUI360 数据集上的预测表现
31
Haozhuang Chi, Jingsong Liang, Ziying Song, Lei Yang, Shihao Li, Haoruo Zhang, Chen Lv
任务设定
联合预测行人姿态与车辆运动的场景演化
痛点动机
现有方法要么忽略行人关节动作要么忽略车辆未来运动
解决方案
提出异构世界模型 PV-WM ,循环推演行人根节点、15 个关节姿态与车辆状态
32
Akash Anand, Abhay Anand, Yash Vishe
任务设定
研究世界模型在异步传感器观测下的预测建模
痛点动机
真实传感器采样率不一致,插值或降采样都会丢失信息
解决方案
用零阶保持读数,并加入陈旧度和待刷新时间作为 Transformer 世界模型的输入特征
33
Junze Bao, Ye Gao, Yiming Huang, Xiaolong Yu, Chen Dong, Qing Gao, Wei Wang, Jinhu Lü
任务设定
实时 3D 高斯泼溅 SLAM 的稠密场景重建与回环检测
痛点动机
现有 3DGS SLAM 系统难以兼顾实时性与地图一致性
解决方案
稀疏特征实现快速跟踪,双线程构建高斯子地图,特征加速配准实现在线回环校正
34
Jin Xu, Xiaojian Huang, Zhuodong Luo, Zhihong Zhang, Xin Liu, Jiansheng Wei, Xinzhi Wang, Jie Zhao, Xuejin Chen
任务设定
构建多视角空间推理数据集提升 MLLM 的 3D 场景理解
痛点动机
现有数据集缺乏结构化 3D 认知路径,多视角空间推理薄弱
解决方案
分层建模感知、场景理解与复杂推理的依赖关系,配合思维链监督训练
35
Logesh Kumar Umapathi
任务设定
十分钟第一视角视频的多选问答任务
痛点动机
智能体流程虽准确但参数量大,难以在端侧部署
解决方案
把大模型感知模块知识蒸馏进 2B 视觉语言模型,单次前向完成推理
36
Yulin Wei, Xiangchen Wang, Jianhui Pan, Jinyu Xiao, Zheng Tan, Ruozai Tian, Guanhua Chen, Feng Zheng
任务设定
评测具身智能体在厨房中的营养管理能力
痛点动机
现有基准不测试食材状态的持续跟踪与知识推理
解决方案
提出 NutriBench-Kitchen 基准,并设计带长时记忆的 Nutri-Vgent 智能体
37
Merve Atasever, Keyan Azbijari, Cagan Bakirci, Alfredo Reina Corona, Tolga Izdas, Richard Yang, Erdem Biyik, Jyotirmoy V. Deshmukh
任务设定
用 LLM 生成规范训练四足机器人步态策略
痛点动机
手工设计奖励函数依赖专家经验、难保证效果
解决方案
让 LLM 生成 PSTL 时序逻辑模板,结合专家轨迹筛选后转为奖励,用 PPO 训练
38
Logesh Kumar Umapathi
任务设定
判断可穿戴设备何时该主动介入提醒用户
痛点动机
标注数据稀缺,介入时机难以准确判断
解决方案
将介入时机转为单 token 分类,用视频智能体生成额外监督信号
39
Jeonghyeok Do, Yun Chen, Munchurl Kim
任务设定
跨传感器统一学习人体骨骼动作表征
痛点动机
不同传感器关节数、拓扑各异,难共享模型
解决方案
用可学习关节槽统一维度,配合语义关节嵌入对齐骨架
40
Zhenxin Li, Nadine Chang, Xinglong Sun, Jingde Chen, Wenhao Yao, Zi Wang, Maying Shen, Yu-Gang Jiang, Zuxuan Wu, Shiyi Lan, Jose M. Alvarez
任务设定
提出离散化行为策略,用于自动驾驶与机器人操作等决策任务
痛点动机
连续生成式策略可解释性差,易产生不合理动作
解决方案
通过随机迭代打分在大规模候选动作库中逐步筛选,兼顾表达力与可解释性
41
Haiyang Sun, Haoxiao Wang, Junming Chen, Weicheng Fang, Zihao Su, Jingkun Yi, Wenyou Yi, Hao Chen, Zhou Zhao
任务设定
面向机器人操作的过程级记忆评测基准
痛点动机
现有 VLA 评测依赖任务成功率,混淆遗忘与操作失败
解决方案
标注存储/更新/压缩三类记忆操作,细粒度评估策略的记忆能力
42
Xiaoyuan Fang, Shuo Feng, Yuxuan Wang, Enhua Cheng, Peng Zhou, Piji Li
任务设定
面向 VLA 模型的目标图像引导式微调,提升操作策略性能
痛点动机
现有基础模型因训练成本高,未系统引入目标图像条件
解决方案
用零初始化卷积渐进注入生成的目标图像特征,实现轻量高效微调
43
Felipe Tommaselli, Thiago H. Segreto, Juliano D. Negri, Ricardo V. Godoy, Marcelo Becker
任务设定
研究腿式机器人运动策略的内部表征质量
痛点动机
策略表征难理解,缺乏训练期预测硬件表现的信号
解决方案
按步态相位分析策略雅可比有效秩,据此改进使 Spot 机器人关节抖动降低约 3 倍
44
Yanlin Jin, Yifan Yang, Bowen Yang, Kai Zhu
任务设定
从立体视频估计手-物体交互场(关节到表面最近点)
痛点动机
遮挡和局部图像证据不足使关节级表面定位困难
解决方案
提出 JSSR 框架,联合预测 3D 关节与交互场,结合跨视角候选搜索和残差门控修正
45
Mahmoud Selim, Cristina Cipriani, Karl H. Johansson
任务设定
离线强化学习中训练扩散策略做连续控制
痛点动机
扩散策略与 RL 结合缺乏严谨的价值函数定义
解决方案
提出噪声空间 Q 函数和噪声空间策略梯度,避免对去噪过程反向传播
46
Mimo Shirasaka, Haochen Zhang, Yonatan Bisk
任务设定
评估 VLM 在具身场景中从说话者视角推理空间关系
痛点动机
现有 VLM 能否像人一样推断说话者视角尚不清楚
解决方案
构建 POVBench 基准,用 3D 场景和多视角图像测试观察者视角定位能力
47
Cristian Sminchisescu
任务设定
构建通用开放世界时序感知系统
痛点动机
现有视频生成模型缺乏显式的几何语义时序结构
解决方案
提出以多模态世界模型为核心的感知范式,融合几何、语义与交互结构
48
Jiahui Zhang, Gongbo Liang, Yu Zhang
任务设定
研究占据世界模型误差如何影响机器人主动建图
痛点动机
占据预测误差会同时改变探索目标和可达路径,但影响未被充分诊断
解决方案
对比不同占据表示做诊断,提出动态过滤策略结合在线观测抑制虚假占据
49
Tan Su, Haoxiang Yang, Ruxin Wang, Binghui Xie
任务设定
物体位置和相机视角同时变化时的机器人视觉运动策略泛化
痛点动机
参考轨迹含可迁移几何信息,但需与当前场景对齐且保持敏感
解决方案
用 RoMa v2 匹配构建 3D 对应关系,结合反事实配对目标训练扩散策略
50
Yijie Zhu, Zitong Yu, Wei Li, Hui Ma, Wen Li, Rui Shao, Liqiang Nie
任务设定
世界动作模型中如何自适应利用想象未来来指导动作生成
痛点动机
现有方法固定利用想象特征,忽略执行进度变化带来的干扰线索
解决方案
提出 ProWAM ,用双时间尺度进度编码器和层级化调制模块按阶段自适应利用想象
51
Shiqi Pan, Qi Zheng, Hanqin Sun, Youjian Zhang, Daquan Feng, Xu Wang
任务设定
连续环境中零样本视觉语言导航( VLN-CE )
痛点动机
现有方法依赖路点预测器或多次调用大模型,延迟高
解决方案
候选路点标记在图像上,单次 MLLM 调用选目标,再用 FMM 规划器避障导航
52
Junyi Hu, Shuaihang Yuan, Yi Fang
任务设定
具身视觉跟踪任务,预测目标未来可观测性以规划动作
痛点动机
动作条件预测易产生因果幻觉,误导跟踪决策
解决方案
提出因果结构化世界模型,分离目标/机器人/观测分支阻断虚假因果,结合模型预测控制规划
53
Yian Wang, Junyi Cao, Xiaowen Qiu, Chuang Gan
任务设定
用图像编辑生成可执行的机器人操作训练数据
痛点动机
人类演示成本高有具身差距,仿真数据又缺语义
解决方案
编辑渲染场景注入任务语义,借助仿真先验恢复 3D 状态并物理精修,生成抓取与目标轨迹
54
Ting Huang, Yue Huang, Zeyu Zhang, Shuicheng Yan, Hao Tang
任务设定
移动机器人的语言指令导航与操作控制
痛点动机
高层语义推理与底层运动控制之间存在脱节
解决方案
用思维链监督与强化学习耦合推理和动作,配推理条件化动作解码器输出可执行指令
55
Shayan Nasiriboukani, Sara Atito, Mohammad Nezamipour, Muhammad Awais
任务设定
无训练地联合完成注视目标预测与语义解释
痛点动机
现有方法依赖大量监督训练且可解释性差
解决方案
利用预训练视觉语言模型加视觉引导提示与记忆检索机制推理注视目标
56
Rasul Khanbayov, Hasan Kurban
任务设定
审计视频生成模型是否真正实现指定物理参数
痛点动机
现有合理性评分测不出错误物理量下的以假乱真视频
解决方案
把生成器当黑盒,从像素中反推物理参数并与请求值量化对比
57
Yuankun Yang, Yi Wei, Bo Bai, Wenyang Zhou, Li Zhang
任务设定
从单目视频重建 4D 场景,含相机视野外区域
痛点动机
现有方法无法恢复相机视野之外的不可见区域
解决方案
提出全景场景对齐,把 3D 不可见区域探索转化为 2D 方向轨迹规划,结合生成先验补全场景
58
Zheng Lu, Haoran Liao, Wanqi Zhong, Yunhe Ni, Lijie Wang, Xingjie Fan, Zhisheng Chen, Yantang Qu, Meijia Chen, Tianyu Xin, Zirui Song, Yiming Li
任务设定
研究 VLA 策略如何自适应利用 VLM 多层视觉语义特征
痛点动机
现有方法固定分配 VLM 层,动作中间状态未显式复用
解决方案
提出 LayerRoute 动态路由 VLM 层并复用动作状态,提升操作性能
59
Hao He, Chengcheng Hu, Zirun Su, Heng Zhang, Haisong Liu, Jinke Li, Haochen Tian, Zhenwei Shen, Hongyang Li, Zhichao Li, Yunchen Yang, Bochao Huang, Siyu Zhang, Kuangye Chen, Xiongjie Zhang, Wentao Dai, Hengchen Dai, Siyuan Liu, Zehao Huang, Naiyan Wang
任务设定
端到端自动驾驶中超越人类示范数据学习驾驶策略
痛点动机
模仿学习受限于人类日志的质量与行为覆盖范围
解决方案
拆分感知与动作模型,用闭环强化学习训练教师策略并蒸馏为纯视觉规划器
60
Francesco Tonini, Lorenzo Vaquero, Mohammad Mahdi Derakhshani, Cees Snoek, Elisa Ricci, Cigdem Beyan
任务设定
零样本人体-物体交互(HOI)检测
痛点动机
全局特征压缩交互线索,难以做细粒度空间推理
解决方案
用部件级注意力分解人和物体,经区域感知 Transformer 融合生成交互表示
61
Bangxun Tang, Heyuan Gao, Yiren Song, Guian Fang, Zijian He, Jie Yang, Mike Zheng Shou
任务设定
电影动态场景中的多角色替换与动画生成
痛点动机
需在替换角色同时保持原始运动、镜头与光影一致
解决方案
将任务建模为结构引导的人体恢复问题,用双向到自回归蒸馏实现高清长视频生成
62
Yongzhe Lyu, Shaofei Wang, Yixin Chen, Siyuan Huang
任务设定
从稀疏视角视频进行 4D 场景重建
痛点动机
单目深度在跨视角、跨时间预测不一致,重建困难
解决方案
用时空神经场统一对齐深度,提升动态高斯溅射重建的几何一致性
63
Todd Y. Zhou, Daniel Zhang
任务设定
研究具身智能体在部分可观测环境下的世界模型学习
痛点动机
预训练表征只优化感知相似性,导致反事实坍塌无法区分干预后果
解决方案
提出反事实潜在世界模型,用对比目标区分不同干预的后果
64
Hongyu Wu, Xu Wu, Tianhao Wu, Jiawei Yu, Phuc Nguyen, Jian Liu, Yi Wu
任务设定
根据文本生成 3D 美国手语( ASL )动作
痛点动机
现有分词器只优化重建,缺语义监督导致动作与文本对不齐
解决方案
提出 SeRV 语义对齐残差向量量化分词器,配合分层 GPT 由粗到细生成动作 token。
65
Masaki Kuribayashi, Zhongkai Shangguan, Eshed Ohn-Bar
任务设定
面向视障人士的第一视角实时辅助导航指令生成
痛点动机
现有 MLLM 缺乏时机把控,指令过早或过晚都影响体验
解决方案
构建大规模基准,监督模型预测指令背后原因,提升实时响应能力
66
Xingjian Ran, Xiaoye Mo, Sihao Liu, Jianyu Zhang, Li Luo, Bo Dai
任务设定
生成多样、可仿真的室内 3D 场景用于具身智能
痛点动机
智能体式方法逼真但耗时,参数化方法快但物理不合理
解决方案
先用图像先验生成初始场景,再由 VLM 智能体分块局部演化优化
67
AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xiong, Linqing Zhong, Yifei Wei, Feng Han, Long Zhang, Da Huang, Nanshu Zhao, Chenghao Yin, Mo Wu, Zhaodong Yan, Kongtao Hu, Yuxiang Yan, Aogelijiang Niyazi, Yu Fang, Jia Zeng, Lizhu Meng, Daizhen Lv, Haoyu Cao, Zhiwen Hou, Lianjin Ye, Yuehan Niu, Zhikai Cai, Xuan Hu, Hui Min, Xiongfeng Cai, Yue Liao, Jing Wu, Soujanya Poria, Ye Li, Sanping Zhou, Maoqing Yao et al. (15 additional authors not shown)
任务设定
面向机器人操作任务的世界-动作模型预训练与扩展
痛点动机
现有 WAM 多依赖预训练视频生成器,预训练与扩展规律尚不明确
解决方案
从零训练控制导向自编码器与单步视觉规划器,结合行为对齐优化联合训练
68
Márcus Lobo, Vitor Matias, Afonso Paiva, Jeová Farias, Tiago Novello, Moacir Ponti
任务设定
综述 3D 视觉-语言模型的原理与应用
痛点动机
传统 3D 深度学习模型难以支持跨模态检索与开放词汇识别
解决方案
系统梳理对比学习对齐、3D 高斯泼溅语言引导及具身智能应用
69
Cheng Yin, Wang Xu, Junpeng Yang, Sikyuen Tam, Hanyu Liu, Yuan Yao, Xiangrui Zeng, Junbo Cui, Yequan Wang, Zhouping Yin, Yankai Lin
任务设定
为长时程机器人操作设计历史记忆机制
痛点动机
现有记忆压缩方法需提前决定保留信息,但不知未来任务需求
解决方案
保留完整历史视频序列直接输入 VLA 骨干,用 flow-matching 动作头解码,无需专门记忆模块
70
Zhuoqiang Cai, Yujie Sun, Chaoyue Niu, Hongyun Yu, Zhiwen Chen, Chengfei Lv, Fan Wu
任务设定
双人对话场景下生成 3D 面部动作
痛点动机
说话动作确定、倾听反应却一对多,难统一建模
解决方案
将动作拆分为确定性说话锚点与随机倾听残差,用 Motion Memory 正则化微调
71
Zhengshu Zhang, Zhiyuan Li
任务设定
评测 JEPA 世界模型在导航、操作任务中的动作排序能力
痛点动机
潜空间距离能否代表真实代价排序从未被验证,闭环重规划掩盖了排序失效
解决方案
提出 ARC-Bench 无泄漏固定候选协议,审计发现冻结 JEPA 世界模型排序严重失效