1
Tong Jian, Aditya Thurvas Senthil Kumar, Xinyi Li, Ziling Chen, Tianyu Dai, Ali Sengul, Matteo Grimaldi, Wenjie Lu, Saleh Nabi, Tao Yu
任务设定
多模态触觉感知实现低延迟滑动检测
痛点动机
现有方案缺乏精确延迟量化和跨平台泛化能力
解决方案
融合压阻阵列与加速度计信号, 240 Hz 因果预测,实现零样本跨平台迁移
2
Jaehun Shon, Jinha Choi, Jongwook Jeon, Jongmin Lee
任务设定
离线强化学习中学习单步流策略
痛点动机
多模态动作分布下单步策略易模式坍塌或利用高估偏差
解决方案
用最优传输耦合价值加权参考策略与单步策略,实现高效多模态蒸馏
3
Roberto Riaño, Gorka Abad, Stjepan Picek, Aitor Urbieta
任务设定
研究预训练世界模型被植入后门以劫持下游控制器
痛点动机
世界模型被当作通用动力学骨干复用,供应链投毒风险易被忽视
解决方案
中毒模型将带触发观测导向特定潜在区域并重塑局部动态,使受害者自身的 Dreamer/MPC 优化过程自行学出攻击者目标动作
4
Andrew Fleet, Soroush Mehraban, Vida Adeli, Cole Clifford, Babak Taati
任务设定
拓扑无关的人脸自动绑定(facial rigging)方法
痛点动机
现有绑定依赖固定拓扑模板,跨拓扑迁移易产生几何伪影
解决方案
融合规范拓扑、跨拓扑迁移及图像线索等多源监督,直接在任意网格顶点预测 FACS 表情形变
5
Zhenjie Yang, Yideng Zhang, Dongjie Zhang, Chenyu Jiang, Xianshuai Liu, Yufeng Li, Zuhao Ge, Xingyu Jiao, Zheng Zhang, Kaiyu He, He Wang, Yuwen Zhong, Yi Deng, Muyun Jiang, Xianliang Huang, Haisheng Su, Donghang Zhang, Jian Zhang, Xue Yang, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan
任务设定
评测 12 种灵巧手的双手视触觉操作基准
痛点动机
不同灵巧手结构、传感器布局差异大,难统一比较
解决方案
构建统一视触觉观测接口,含 26 个任务和 1300+ 次人类遥操作演示
6
Ziqian Fan, Shibo Xu, Junjie Li, Xiangyu Zhao, Shengyuan Ding, Yifan Yang, Zhenjie Yang, Haodong Duan, Yue Zhou, Zhihang Zhong, Xue Yang
任务设定
评测多模态智能体的视频上下文学习与交互策略能力
痛点动机
智能体难将视频演示转化为可执行策略并适应新环境
解决方案
提出 342 个任务的 V-ICAL 基准,测状态定位、规划与自适应能力
7
Xintong Fang, Zhiyuan Fang, Rengan Xie, Xuhong Zhang, Guoyuan An, Zeran Liu, Jingyan Zhang, Jiarui Guo, Yuchi Huo
任务设定
从文本生成可执行的物理一致动态 3D 场景
痛点动机
动态场景生成需兼顾结构、时序与物理可行性
解决方案
用 LLM 构建演化场景图,经可微分仿真优化物理参数并输出可执行场景
8
Dingjie Fu, Dianxing Shi, Yangyang Xu, Jun Yu
任务设定
从无标注视频中学习隐动作模型供机器人策略使用
痛点动机
发现重建误差低不代表隐动作学得好的错配问题
解决方案
提出 ACT-LAM ,用动作查询 IDM 和动作 token FDM 强化动作提取与利用
9
Davit Soselia, Joseph JaJa, Amitabh Varshney
任务设定
面向 3D 场景问答的 3D 高斯语言场表征稀疏化
痛点动机
密集语义特征存储和推理开销巨大,冗余度未知
解决方案
提出物体级 token 稀疏化,仅用不到 1%的嵌入即保持问答性能
10
Dylan Waldner, Yiannis Kantaros, Guido Governatori, Risto Miikkulainen, Amir Banifatemi
任务设定
基于世界模型的机器人规划中加入法律约束
痛点动机
需让机器人行为执行前就合法合规,而非事后补救
解决方案
用可废止道义逻辑约束运动规划器,世界模型同时提供规划与法律语境信息
11
Jianhe Zhao, Yanhua Qiu, Zhiyu Zhang, Zibo Zhao, Jinhua Xie
任务设定
单目零样本视觉语言导航( VLN-CE )
痛点动机
现有方法依赖额外传感器,几何与语义表征易不一致
解决方案
用在线 3D 重建网络预测深度与位姿,结合 LangGraph 状态编排实现语义导航
12
Hanzhang Tu, Zhanfeng Liao, Wei Min, Jiajun Zhang, Yebin Liu
任务设定
从稀疏无位姿相机流实时重建人体自由视角视频
痛点动机
现有方法依赖离线优化或标定相机,难以实时渲染高清画面
解决方案
多视角 Transformer 单次前向预测相机位姿与 3D 高斯,并蒸馏几何先验保持一致性
13
Yixuan Jia, Jonathan P. How
任务设定
让预训练机器人策略在推理时遵循字典序偏好
痛点动机
部署时新增的优先级约束在训练阶段并未出现,难以兼顾
解决方案
用动态屏障引导约束采样过程,并按优先级级联筛选候选轨迹
14
Jinwoong Kim, Sangjin Park
任务设定
分析 VLA 策略 各模态在不同执行阶段的贡献度
痛点动机
现有归因方法忽略阶段依赖性和跨阶段传播效应
解决方案
划分行为阶段为归因单元,用反事实闭环重执行量化各模态贡献
15
DeepCybo Team, Yu Bin, Haipeng Cao, Zheng Chang, Kai Chen, Youning Chen, Kailin Deng, Yichao Du, Xiaotong Fu, Haoyang Ge, Yunlong Guo, Chenliu Hao, Jiyan He, Xuguo He, Yakun Hou, Kai Hu, Cong Huang, Tuopusen Huang, Yu Huang, Hong Li, Peize Li, Shijie Lian, Xiaopeng Lin, Yun Lin, Haibao Liu, Haochen Liu, Qiuzhi Liu, Shengcai Liu, Zhiqiang Liu, Tao Luo, Peng Ren, Shuo Ren, Chaoyi Ruan, Zhaolong Shen, Yukun Shi, Qiyuan Su, Yuxuan Tian, Yining Wang, Changti Wu, Hao Wu, Xueyin Xu, Ruoqi Yang, Zhaoyang Yang, Hang Yuan, Zhaoyang Zeng, Hanwen Zhang, Ruimeng Zhang, Yao Zhang, Yibo Zhang, Yuxiang Zhang, Zhirui Zhang, Ziyi Zhang, Zubin Zheng, Zishen Zhuang et al. (24 additional authors not shown)
任务设定
统一具身环境理解、动作生成与未来预测
痛点动机
视觉语言模型难以直接产出物理动作与场景变化
解决方案
将末端执行器运动、视觉目标离散化为序列,用自回归方式与语言联合训练,仅用人类交互视频做具身预训练
16
Beibei Jing, Tianle Guo, Youjia Zhang, Zikai Song, Yawei Luo, Junqing Yu, Tao Guan, Wei Yang
任务设定
文本驱动 3D 人体动作生成
痛点动机
3D 动作数据稀缺,难以覆盖多样文本描述
解决方案
构建跨模态动作分词器,把 3D 动作 token 投影到 2D 视频域,借助动作视频扩充动作码本
17
Geigh Zollicoffer, Minh Vu, Rajiv Ranasinghe, Manish Bhattarai
任务设定
审计多模态世界模型视频与文本预测的一致性
痛点动机
同一模型不同模态输出可能互相矛盾,且偏离真实物理
解决方案
构建物理约束对比流程,量化事件、幅度、时序等维度的内外部不一致
18
Daniel Gigliotti, Flavio Maiorana, Fabio Patrizi, Luca Iocchi
任务设定
研究腿式机器人多技能间的平滑切换与组合
痛点动机
独立训练的技能各自可靠,但切换衔接处容易失效
解决方案
把技能组合当作独立课题,用可验证的策略切换机制连接子策略,使上层规划器可安全调度
19
Damian Benasco, Juan Carballeira-Lopez, Jaime Ramos-Rojas, Julio S. Lora-Millan, Antonio J. Del-Ama, David Rodriguez-Cianca, Pablo Lanillos
任务设定
生成用于外骨骼和康复的下肢步态轨迹
痛点动机
传统步态模板难以适应个体差异和不同行走条件
解决方案
用条件扩散模型(含自适应归一化、无分类器引导)生成可控且符合生物力学的关节角轨迹
20
Guocun Wang, Kenkun Liu, Guorui Song, Jing Lin, Zhe Huang, Luyuan Zhang, Dake Zhong, Choo Sin Wai, Xiaoguang Han, Haoqian Wang
任务设定
统一开放世界运动语言理解与生成任务
痛点动机
动作常被当作语言附属模态,跨模态交互不足且自回归易累积误差
解决方案
扩展词表加入运动 token 形成统一 token 空间,并用 CoT 推理连接语言与动作生成
21
Avijit Dasgupta, Shayon Dasgupta, Zakaria Laskar, C. V. Jawahar, Karteek Alahari
任务设定
评测 MLLM 在第一人称视角拼图引导任务中的表现
痛点动机
拼图需要精细空间推理,现有 MLLM 能力尚未验证
解决方案
提出 PuzzleMate 框架与基准,通过人机协同评估分步指导能力
22
Jiaming Tan, Mingliang Zhai, Zhen Li, Yuwei Wu, Chuanhao Li, Kaipeng Zhang
任务设定
研究相机可控的流式视频世界模型生成
痛点动机
局部视角需记忆离屏内容,全局表征又难以流式渲染
解决方案
解耦全景状态演化与透视视频合成,蒸馏为少步流式生成
23
Zhiling Chen, Jingzhan Ge, Ruimin Chen, Matthew P. Castanier, David Gorsich, Farhad Imani
任务设定
双臂机器人执行任务指定的计量检测
痛点动机
通用 VLA 智能体难保证测量证据完整可信
解决方案
结合 VLA 操作与激光测量,用确定性证据门控保证结果可追溯
24
Xin Feng, Eleonora D'Arnese, Mohan Sridharan
任务设定
面向非标准体型的运动风格迁移
痛点动机
现有方法风格迁移与体型适配难兼顾,易泄露内容
解决方案
用形状条件 FSQ-VAE 解耦风格、内容与体型,生成风格化运动
25
Zhewen He, Junyi Yu, Haomian Huang, Zhenhua Li, Yi Fang
任务设定
给定驱动视频和参考帧生成手语模仿视频
痛点动机
现有方法易导致手形漂移和时空不稳定
解决方案
用刚体规范化分离运动,结合姿态迁移与扩散模型生成视频
26
Feiyu Du, Xi He, Jia Li, Yapeng Tian, Weili Wu
任务设定
自我中心视频中在线判断谁在对摄像佩戴者说话
痛点动机
离线整段分类脱离实际交互,且忽略多样的非 TTM 说话状态
解决方案
构建逐帧标注新数据集,用融合音频、视觉与语音语义的多模态模型做在线判断
27
Kunwei Wu, Xiang Liu, Guocai Yao, Junming Chen, Zhikang Chen, Min Zhang, Pengwei Wang, Sen Cui
任务设定
从反事实世界模型的预测差异中提取物体运动信息
痛点动机
不同目标帧掩码生成的响应可靠性不一,均匀加权聚合效果差
解决方案
训练轻量可学习物理裁判器给候选响应打分加权,再定位修正运动
28
Luoyang Sun, Guoyang Xia, Fengfa Li, Lei Ren, Xinyu Cui, Haifeng Zhang, Fangxiang Feng, Kaike Zhang, Kun Zhan, Yan Xie, Jun Wang, Cheng Deng
任务设定
系统研究 VLA 模型中动作头设计、规模与延迟的权衡
痛点动机
各模块对性能的真实贡献不明确,此前缺乏延迟对齐的对比实验
解决方案
发现动作头初始化方式(复制语言层权重)是决定性能的关键,比解码器架构更重要
29
Chenwei Wang, Dianye Huang, Match W. L. Ko, Chenjia Bai, Zhongliang Jiang
任务设定
用人类第一视角数据做 VLA 机器人后训练
痛点动机
人机数据混合易因跨具身差异降低策略性能
解决方案
用跨具身视觉运动表征检索相似人类演示,再按相似度做样本加权融合
30
Saksham Bansal, Om Naphade, Chayan Aggarwal, Vrishin M
任务设定
在世界模型潜空间中高效规划动作序列
痛点动机
搜索式规划计算量大,摊销策略在接触密集任务上易失效
解决方案
提出摊销迭代控制器,用到达并保持目标训练,减少规划所需预测次数与延迟
31
Cheng Chen, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Wen Wang, Yihao Meng, Hanlin Wang, Yixuan Li, Jiacheng Wei, Zhenshan Tan, Yanhong Zeng, Yujun Shen, Guosheng Lin, Fayao Liu
任务设定
基于视频模型的交互式数字人长时模拟
痛点动机
长时多轮视频生成易画质退化、动作不连贯
解决方案
用 MLLM 做路由,配合锚定视频续接模块保证过渡稳定,支持复杂姿态变化
32
Jiaheng Chen, Jiaxing Li, Leixia Wang, Jianan Ju, Tinghe Zhang
任务设定
人群轨迹预测中社交线索的激活时机问题
痛点动机
现有方法只关注社交信息编码,忽视其生成时该何时起作用
解决方案
提出生成感知偏置激活模型,按证据强弱动态调节社交与个体偏置的参与度
33
Jinting Hang, Zhenhui Cai
任务设定
机器人部署中相机、动作接口、动力学多重偏移同时适应
痛点动机
传统方法需为每种偏移组合单独微调,成本高昂
解决方案
分别学习单因素偏移算子,用算子组合外推到混合偏移,无需混合微调
34
Tingjun Huang, Dmitry Rudshin, Mathieu Meyer, Pietro Bonazzi, Marc Pollefeys, Emilia Szymańska
任务设定
从全景视频重建场景并估计相机轨迹
痛点动机
长轨迹在重复纹理、弱纹理场景中易累积漂移
解决方案
将全景图视为四视角虚拟相机组,检测修复不一致预测,通过闭环检测和位姿图优化校正漂移
35
Changbo Yan, Zhongbo Zhang, Zaibin Zhang, Yifan Wang, Lijun Wang, Huchuan Lu
任务设定
杂乱遮挡场景下机器人的 3D 扩散策略 操作
痛点动机
目标物体被遮挡或与相似干扰物混杂时难以定位
解决方案
用开放词汇分割生成物体级 3D 先验,通过三重场注意力条件化增强 DP3 扩散骨干
36
Qinwu Xu, Yifan Jiang
任务设定
诊断 VLM 在机械臂操作提示中的可供性定位失败
痛点动机
直接给出部件名称掩盖了视觉定位与机械推理的真实能力
解决方案
用反事实测试及信息拆分,分离视觉定位、机械推理与类别关联能力
37
Mahsa Mohammadi, Sareh Rowlands
任务设定
带噪声干扰下的第一视角动作预测鲁棒性
痛点动机
现有方法假设观测干净,缺帧掩码等干扰会导致预测失效
解决方案
用时序可靠性抑制加权编码,结合动词-名词图解码修正不合理组合
38
Yuhua Jiang, Junjie Lu, Feifei Gao
任务设定
审计视频世界模型测试时扩展的采样收益转化
痛点动机
采样候选变多,但验证器未必能可靠选出更优结果
解决方案
提出 Compute-Value Audit 框架,发现自适应选择策略常不敌均匀采样