1
Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan
任务设定
3D 场景理解任务中动态编排多模态输入
痛点动机
固定模态组合引入噪声、浪费算力,未按查询自适应
解决方案
提出 SmartMage ,用语义路由模块按需选模态并激活专家,实现自适应多模态推理
2
Paritosh Parmar, Landy Lan, Hong Yang, Chen Yi, Chiat Pin Tay
任务设定
隐私保护场景下的课堂异常行为识别
痛点动机
监控视频需保护隐私,现有方法难兼顾效率与泛化
解决方案
构建层级化运动学表征,将大教师模型的多阶运动推理蒸馏给轻量学生模型
3
Liangyang Ouyang, Ruicong Liu, Xuangeng Chu, Kaipeng Zhang, Yoichi Sato
任务设定
让视频世界模型中的角色能与用户社交互动
痛点动机
现有视频世界模型缺乏用户与角色的互动能力
解决方案
提出自蒸馏训练管道学习互动与镜头运动,推理时用训练无关模块定位互动响应时机
4
Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie Zhang, Xiaocheng Lu, Haobin Zhong, Xiaotong Zhao, Alan Zhao, Song Guo
任务设定
提升视频世界模型长时程动作预测一致性
痛点动机
长程动作序列无真值状态,漂移误差难以验证
解决方案
构造可逆动作循环做自监督验证,用空间闭合与时间一致性奖励做强化学习
5
Chengming Feng, Hesam Araghi, Liming Zheng, Julien Dupeyroux, Xucong Zhang, Jan van Gemert, Nergis Tömen
任务设定
构建自视角双目事件相机厨房烹饪数据集
痛点动机
现有事件相机数据集缺少自然、无脚本的人类日常动作标注
解决方案
10 人在 13 个厨房自然烹饪,头盔采集双目事件相机、RGB、深度、IMU 数据,标注动作与物体框
6
Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li
任务设定
个性化烹饪机器人的可信自动化控制
痛点动机
纯规则控制难个性化,大模型控制又不透明不可靠
解决方案
多智能体把语言指令转成结构化流程程序,基于原子动作库生成可执行代码并闭环执行
7
Houze Xu, Jizhong Li, Ziyi Ye
任务设定
VLA 模型的长时程任务规划与执行
痛点动机
任务时序难保持一致,执行误差易累积
解决方案
分层架构:高层 VLM 语义推理并更新语言记忆与子任务指令,低层 VLA 负责精细连续控制
8
Alireza Javanmardi, Vippin Kumar Jeetmal, Christen Millerdurai, Alain Pagani, Didier Stricker
任务设定
上半身虚拟人的面部表情与手势联合重建动画
痛点动机
现有方法难兼顾面部精细度与手部姿态精度
解决方案
分别建模面部和双手并融合进参数化上半身网格,再用 3D 高斯泼溅渲染多视角动态形象
9
Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Bailin Li, Yan Wang
任务设定
将世界动作模型扩展到移动操作的全身控制
痛点动机
现有模型局限桌面操作,忽视移动时场景动力学耦合
解决方案
融合视频扩散主干与动作专家,用混合专家分离移动/操作动力学,链式预测提供密集监督
10
Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu
任务设定
提升动作条件世界模型的动作可控性
痛点动机
模型易走视觉惯性捷径,动作与预测未真正因果关联
解决方案
提出反事实一致性框架 CoCo ,约束多步及镜像场景下预测保持动作依赖,并给出 ARC/DE 新指标
11
Jiuhe Qu, Yingping Liang, Ying Fu
任务设定
压缩 3D 视觉语言模型的冗余视觉 token
痛点动机
多视角 3D 场景 token 冗余度高,推理开销大
解决方案
提出分层空间聚类压缩框架:先跨视角合并冗余 token ,再在聚类内剪枝保留细节
12
Yuqian Fu, Tianwen Qian, Yanjun Li, Yu Li, Kunyu Peng, Xu Zheng, Yongqin Xian, Alessio Tonioni, Yanwei Fu, Xiaoling Wang, Danda Paudel, Federico Tombari, Luc Van Gool, Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Yingcong Chen, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie, Takuya Murakawa, Toru Tamaki, Yi Wen, Zhenglin Du, Zhengyang Li, Lingling Li, Licheng Jiao, Wenping Ma
任务设定
跨领域第一视角视频问答基准与挑战赛
痛点动机
检验 MLLM 能否泛化到手术等罕见第一视角场景
解决方案
组织 EgoCross 挑战赛,设受限/开源两赛道评测跨域第一视角问答
13
Seunghyeon Song, Joo Chan Lee, Chanung Park, Jun Young Jeong, Minseo Lee, Eunbyung Park, Jong Hwan Ko
任务设定
压缩 4D 高斯泼溅动态辐射场的存储开销
痛点动机
现有锚点方法参数容量固定,难以兼顾运动复杂度与压缩率
解决方案
提出自适应容量锚点,按时空复杂度动态分配高斯数量与特征维度
14
Chen Yang, Shenxiang Zeng, Haoyang Zhao, Zhouyuan Xu, Youquan He, Haoyu Li, Mingyi Deng, Jiansheng Fan, Chen Wang
任务设定
基于视频构建可执行世界模型做物理推理
痛点动机
VLM 难以理解物体运动交互及反事实变化
解决方案
免训练重建动态场景与 6D 位姿,拟合解析动力学支持推演与反事实提问
15
Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang
任务设定
给定第一视角观测和任务,规划下一步并分割功能区域
痛点动机
现有方法难以联系语义角色与多步规划
解决方案
提出 EgoAfford 基准与 EgoLens 模型,用角色专属掩码解码器分割物体、工具与目标区域
16
Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta
任务设定
测试时检测扩散式 VLA 策略的失败风险
痛点动机
策略可能生成脱离视觉语言依据的合理动作
解决方案
通过消融 KV 缓存 关键条目构造反事实对比,提取接地诊断信号判断失败
17
Weiheng Zhao, Haoyi Jiang, Xin Shi, Liu Liu, Fan Huang, Zhizhong Su, Wei Sui, Xinggang Wang
任务设定
机器人操作中高效的世界动作模型推理
痛点动机
现有 WAM 在推理速度与未来推理带来的鲁棒性间难兼得
解决方案
提出 Faster-WAM :仅计算一次未来表征后稀疏复用,兼顾速度与分布外泛化能力
18
Yan Zhang, Yinan Wu, Haoran Duan, Jungong Han
任务设定
解决 VLA 模型操作任务中的视觉压制问题
痛点动机
视觉信息远比语言指令密集,策略易绕过指令产生因果混淆
解决方案
提出反事实干预框架 CofactVLA ,构建语言掩码反事实分支,在动作与特征两级抑制视觉混淆项
19
Harshitha Rajaprakash, Aditeya Prajapati, Rong Xue, Abrar Anwar, Jesse Thomason
任务设定
检测 VLA 策略部署时的执行失败
痛点动机
分布偏移下风险探针校准易失配部署场景
解决方案
用对比集扰动改进隐藏状态风险探针的训练与校准,提升失败检测能力
20
Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato
任务设定
为跨本体灵巧操作挖掘有效的人类视频训练数据
痛点动机
海量自我中心视频中难辨哪些数据真正有用
解决方案
借鉴推荐系统三层筛选流程,仅用 <5% 数据使成功率从 47.7% 升至 61.1%
21
Duo Zhang, Zhehui Yin, Zhiyun Yao, Haotong Qin, Xusheng Zhang, Hongliu Yang, Jianyu Sun, Junzhe Wang, Zizhou Fan, Michele Magno, Daqing Zhang
任务设定
用毫米波雷达感知人体行为并生成语言描述
痛点动机
雷达信号难与语言对齐,且缺乏人体结构监督
解决方案
用同步 3D 姿态作为训练期监督预训练雷达编码器,再对齐 LLM 实现行为描述与问答