1
Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen
任务设定
交互式世界模型的长时记忆与实时视频生成
痛点动机
控制需短时程记忆需长时程,二者结构性矛盾
解决方案
训练时用混合注意力窗口分离两种能力,推理时用位姿索引地标库限定有界内存,蒸馏至四步实时生成
2
Khiem Vuong, Deva Ramanan, Srinivasa Narasimhan
任务设定
修复稀疏视角下 3D 渲染的伪影
痛点动机
现有修复方法局限于特定 3D 表示,需定制架构重训练
解决方案
复用预训练视频生成模型做视频到视频翻译,用掩码锚定保留干净像素,并以位姿一致性做 DPO 优化
3
Richard Bao
任务设定
检验并修正世界模型内部的物理不变量
痛点动机
世界模型预测视频时可能并未真正遵守物理规律
解决方案
通过无标签搜索找到类能量的不变量,推理时把隐状态投影回初始能级以降低漂移误差
4
Yiren Lu, Xin Ye, Jiaming Liu, Jin Yao, Yi-chung Chen, Liam Merino, Dhruva Dixith Kurra, Min Cai, Tom Lampo, Yu Yin, Danhua Guo, Burhan Yaman
任务设定
自动驾驶中联合预测场景演化与自车轨迹
痛点动机
像素纠缠外观与几何,难以还原 3D 场景动态
解决方案
用点云几何代替像素预测未来场景,再用几何条件动作头推算轨迹
5
Sangoh Lee, Sangwoo Mo, Wook-Shin Han
任务设定
让 VLA 模型的动作解码器学习行为背后的意图
痛点动机
单纯行为克隆学不到动作背后的语义目标
解决方案
用冻结教师 VLM 提取行为意图,蒸馏进动作解码器辅助预测
6
Andrej Orsula, Miguel Olivares-Mendez, Carol Martinez
任务设定
太空机器人在硬件损坏后的在线适应
痛点动机
太空中缺乏外部跟踪,难以计算真实奖励信号
解决方案
预训练世界模型学习奖励结构,仅用想象轨迹更新动力学和策略
7
Federico Stella, Fei Jiang, Zhongshi Jiang, Zohar Barzelay, Emanuel Garbin, Amin Jourabloo, Liuhao Ge
任务设定
高分辨率多视角人脸新视角合成
痛点动机
扩散模型需 2D 预训练,多相机一致性难保持
解决方案
用下一尺度自回归架构替代扩散模型,结合多视角 3D 高斯完成重建
8
Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang
任务设定
长时长音视频叙事生成与交互式世界导航
痛点动机
长视频生成难保持角色身份、语音与相机稳定性
解决方案
提出 JoyAI-Echo-1.5 统一系统,用跨镜头记忆保持角色一致,6-DoF 轨迹控制相机漫游
9
Alperen Avan, Jordi Sanchez-Riera
任务设定
室内自主导航:融合语义理解与几何控制
痛点动机
纯 VLM 导航慢且不精确,稠密建图成本高
解决方案
提出 OptiSight 框架,用 Grounded-SAM 定位目标,视觉伺服几何控制降低 VLM 调用频率
10
Chengqun Yang, Liang Xu, Yanping Li, Fulong Liu, Jingnan Gao, Weili Zeng, Yichao Yan
任务设定
文本驱动的人体运动生成任务
痛点动机
VQ 离散化丢失信息,整体表示缺乏部位可控性
解决方案
提出时空解耦框架,关节级 VAE 结合自回归扩散实现可控生成
11
Yue-Yi Zhang, Ming Gong, Linpu He, Wei-Shi Zheng, Zhilin Zhao
任务设定
统一潜空间中渐进学习异构角色控制技能
痛点动机
多来源、多监督形式的技能难以共享复用
解决方案
共享运动解码器,用运动直觉蒸馏统一追踪与文本生成等任务
12
Zhiruo Zhou, Zelin Li, Xiwen Chen, Jiazhuo Li, Chenwei Wang, Huiming Chen, Xiaojun Zhu
任务设定
检索增强 VLA 机械臂策略时的指令控制问题
痛点动机
追加文本改变指令形式即可致成功率骤降至 3%
解决方案
提出 TOWN-VLA 权限接口,仅兼容时才授权替换指令,否则保留原 prompt
13
Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu, Yilang Sun, Shiyi Zhang, Haoran Li, Xiaoxiao Ma, Yuming Li, Yijun Liu, Yaofeng Su, Yanwen Ma, Haoyu Wu, Zihan Su, Yue Ma, Lvmin Zhang, Haoyang Huang, Zeyue Xue, Anyi Rao, Nan Duan
任务设定
构建可导航交互的全模态世界模型(视频+音频+语音)
痛点动机
现有世界模型难以统一多模态生成与长时轨迹控制
解决方案
共享 6-DoF 轨迹统一一/三人称控制,渐进式+自回归训练支持长时生成
14
Xiwen Chen, Zelin Li, Zhiruo Zhou, Huiming Chen, Chenwei Wang, Xiaojun Zhu
任务设定
为 VLA 机器人操作模型设计类型化空间定位接口
痛点动机
文本坐标或动作 token 表达空间信息导致接口脆弱、效率低
解决方案
用类型化空间读出头替代文本坐标,作为 π0.5 策略引导显著提升操作成功率
15
Tong Wang, Huan Deng, Mucheng Yang, Yang He, Xiaohui Kuang, Gang Zhao
任务设定
系统评估世界模型能否替代传统仿真器
痛点动机
视频生成快速发展,但与真正仿真器的能力差距缺乏系统评估
解决方案
梳理 200 篇工作在 8 项仿真器能力上的表现,指出状态反馈是最大短板并给出改进方向
16
Min Chen, Shengjun Zhang, Yuxin Li, Zhang Zhang, Xin Fei, Chong Xia, Yueqi Duan
任务设定
具身智能体的主动探索与推理任务
痛点动机
现有方法单步短视探索,难应对遮挡环境的延迟反馈
解决方案
提出多步并行树搜索框架,并行模拟多条未来轨迹,用验证器动态剪枝选优
17
Virmarie Maquiling, Zhuojiang Cai, Enkelejda Kasneci
任务设定
第一人称视角注视点(gaze)的跨数据集建模
痛点动机
原始注视轨迹嘈杂,离散事件标签又丢失局部运动结构
解决方案
提出基于角位移的运动化注视点分词方法,兼顾可解释性与跨数据集迁移能力
18
Luca Rossetto, Werner Bailer, Cathal Gurrin, Graham Healy, Omar Shahbaz Khan, Stevan Rudinac, Klaus Schöffmann, Allie Tran
任务设定
CVPR 2026 第一人称视觉研讨会 CASTLE 挑战赛结果报告
痛点动机
缺少对异步第一人称视觉任务参赛方案的系统性总结
解决方案
汇总首届 Asynchronous CASTLE 挑战赛的参赛方法与评测结果
19
Lars Osterberg, Maggie Wang, Mac Schwager
任务设定
统一 VLA 模型的记忆与动作控制,处理长时序任务
痛点动机
现有记忆方案依赖额外 VLM,存在记忆瓶颈和训练割裂
解决方案
提出 UniMem 框架,用事件分类器和关键帧编码构建统一记忆机制,单一骨干网络同时处理记忆与控制
20
Jianxiang Liu, Gaojing Zhang, Chuan Wen, Qipeng Liu, Yuxuan Zhao, Ning Guo, Wenzhao Lian
任务设定
基于人类视频进行长时序机器人操作的模仿学习
痛点动机
端到端 VLA 模型不透明数据重,分层方法缺在线反馈易开环幻觉
解决方案
用实例化三元组表示子目标并转为轨迹先验,在线监测进度实现闭环重规划
21
Xiang Li
任务设定
从多视角图像回归可动画化 3D 人脸网格
痛点动机
人工重拓扑人脸网格费时费力,难以规模化生产
解决方案
用合成多视图数据训练神经网络,结合相机参数与 3D 关键点正则化直接回归标准化人脸网格
22
Vivek Chavan, Jörg Krüger
任务设定
从第一/第三人称视频提取装配拆卸任务知识
痛点动机
专家装配拆卸经验难记录、难复用、难迁移
解决方案
联合编码视频与语音解说,构建结构化任务表示,实现情境化工人指导
23
Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen
任务设定
从第一人称视角预测未来双手运动
痛点动机
现有端到端方法忽略操作过程建模,梯度相互干扰
解决方案
两阶段框架:先学显式操作规划,再据此生成运动,避免相互干扰
24
Zhanpeng Shi, Zi Liang, Rong Feng, Shiqin Tang, Xuyang Chen, Hongzong Li
任务设定
评测世界模型在极端输入下的预测失效情况
痛点动机
现有评测只看平均误差,忽略罕见工况下的灾难性崩溃
解决方案
提出 BasinLens ,结合不确定性引导的全局搜索与局部类型化扰动挖掘失效案例
25
Dongzhou Cheng, Ziang Li, Yixiao Zhou, Haojuan Li, Jinghao Zhang, Lei Lei, Minjing Dong, Jie Gui, Jiaqi Wang
任务设定
提升双臂机器人操作策略的鲁棒性
痛点动机
查询式 VLA 模型易受多视角与语言融合不稳定干扰
解决方案
提出模态掩码机制 M3 ,训练时随机遮蔽部分模态通道
26
Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang
任务设定
对世界动作模型做在线策略蒸馏后训练
痛点动机
蒸馏后学生模型在分布外状态下能力退化
解决方案
学生自主生成轨迹,冻结教师模型标注视频与动作目标联合训练
27
Masoud Jalayer, Changyi Li, Yu Xiao
任务设定
预算受限下对第一视角长视频做 VLM 字幕生成
痛点动机
逐窗口调用 VLM 代价高,现有筛选方法仍需先解码视频
解决方案
用音频优先筛选窗口,检测器按动作而非逐帧触发
28
Milo Piccioli, Gianluca Amprimo, Claudia Ferraris, Gabriella Olmo
任务设定
从 2D 单目输入估计 3D 手部姿态
痛点动机
3D 手部标注数据稀缺,远少于人体运动数据
解决方案
将预训练人体姿态编码器迁移到手部,加轻量适配模块对齐运动学
29
Xunzhe Zhou, Yiyang Cai, Fengyi Wang, Ran Ju, Hanxiang Ren, Ruizhe Liu, Yu Zhang, Qian Luo, Feng Chen, Pei Zhou, Yi Ma, Yanchao Yang
任务设定
评测机器人从人类演示中意图级模仿的能力
痛点动机
现有策略只会复现轨迹,难以理解演示者的真实任务意图
解决方案
提出四级基准与配对数据集 IG-10K ,发现功能替代是意图模仿的关键瓶颈
30
Haoran Lin, Mingyu Yang, Pengfei Qi, Kehan Chen, Qiang Diao, Liangji Zeng, Wenrui Chen, Yaonan Wang, Kailun Yang
任务设定
四足机器人对铰接物体的移动操作任务
痛点动机
导航与操作衔接不足,接触过程易抖动、不稳定
解决方案
提出任务导向导航结合动作-速度分块学习的统一框架,提升持续接触操作稳定性
31
Jiaqi Wang, Zhuo Zhang, Haining Guan, Tingguang Zhou, Haowen Cui, Zhongyang Zhu, Yulong Zheng, ChuanYe Wang, Xuefeng Chen, Zhen Yang, Tianchen Deng, Feiyang Tan, Hangning Zhou, Bo Dai, Lixia Shen, Xiwu Chen, Xiyang Wang, Jiajun Zhu
任务设定
构建世界模拟器与驾驶动作模型的自我提升闭环
痛点动机
现有模拟器生成的周围车辆行为不真实,数据分布失衡
解决方案
提出 BehaviorFlow 元动作条件轨迹生成模型,结合世界模拟器渲染真实交互场景
32
Yubo Zhu, Zhehan Kan, Jingyi Yang, Miaolin Chen, Jinbo Xing, Kai Zhu, Zijian Wang, Sheng Zhong, Wei Tong
任务设定
统一多模态模型中视觉生成能否助力视觉理解的诊断评测
痛点动机
现有评测混淆任务难度与推理范式,结论不一致
解决方案
提出 VGAU-Diag 细粒度评测框架,发现瓶颈常在理解侧而非生成侧
33
Gwen Yidou-Weng, Edward Sun, Tianyi Ma, Metin Alp Dogan, Benjie Wang, Allen Peng, Guy Van den Broeck, Yuchen Cui
任务设定
让 LLM 为机器人生成可执行且满足约束的计划
痛点动机
软方法无形式保证,符号规划器又丢失常识推理
解决方案
提出 Meta-Ctrl 约束解码框架,用元 token 分离语法与语义约束,兼顾正确性保证与计划质量
34
Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Jie Cheng, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren
任务设定
机器人操作任务中预测动作而非生成视频帧
痛点动机
视频生成作为世界模型中间目标耗费算力且非必要
解决方案
提出 DELE-w0.5,从预测的未来潜在状态直接推断动作序列,跳过视频生成
35
Shuo Feng, Piji Li
任务设定
具身智能体依据语言指令导航并定位目标物体
痛点动机
现有方法混同视角与物体特征,导致视觉表征模糊
解决方案
提出 ViSMoE ,用视觉感知路由的稀疏专家分别编码视角与物体特征
36
Zhiyang Deng, Boran Zhang, Danze Chen, Yeying Jin
任务设定
游戏世界模型中实现状态感知的 NPC 行为生成
痛点动机
现有方法将 NPC 决策与视频生成纠缠,响应不够可控
解决方案
提出解耦四层架构(理解-决策-控制-生成),形成闭环交互驱动 NPC 行为
37
Xinyuan Wu, Jingrao Zhang, Mengdi Xu, Henry K. Chu, Mingguang He, Danli Shi
任务设定
把诊室照片转为可测试的数字孪生场景
痛点动机
真实临床环境搭建具身 AI 测试场景成本高难扩展
解决方案
重建带碰撞体、语义标注的仿真场景,支持多机器人闭环策略评估
38
Farida Mohsen, Thowayba Elkaffash, Mohammad Reza Chalak Qazani, Mohamed Mabrok, Nader Meskin, Ali Safa
任务设定
研究 VLA 模型动作专家的精度-效率权衡
痛点动机
长执行视野下 Transformer 动作专家成功率明显下降
解决方案
用 Mamba 选择性状态空间替代自注意力,长视野下性能提升 7.8%
39
Bingqi Huang, Bingchuan Wei, Yingkai Cai, Zhaokui Wang
任务设定
提升世界动作模型对新视角的鲁棒性
痛点动机
视角变化是 WAM 最大扰动源,直接约束易损害动作预测
解决方案
提出 SCVC ,仅对视角不变的动作分量施加一致性约束,无需相机参数