1
Zian Meng, Zhen Li, Chuanhao Li, Qiang Li, Kaipeng Zhang
任务设定
游戏中关节角色的交互式世界建模与渲染
痛点动机
隐空间自回归易导致姿态几何长期漂移、一致性差
解决方案
显式预测 3D 世界状态(骨骼姿态轨迹),经零参数渲染器转控制信号,再用视频扩散合成画面
2
Yuxuan Chen, Wanruo Zhang, Xiao Li
任务设定
针对动态反应式操作任务评测 VLA 模型能力
痛点动机
现有基准仅评估静态操作,忽略动态交互场景
解决方案
提出 ReflexBench 基准和 ReflexVLA 模型,用潜在未来预测与多帧时序融合加速响应
3
Yuyang Liu, Yanqing Shen, Ruike Chen, Jifan Zhao, Yuxuan Tian, Yichi Zhang, Tianfeng Long, Zixuan Yin, Yipu Wang, Ziheng Qin, Wenxing Tan, Yang Shi, Mingyu Cao, Runze Xiao, Ziqi Wang, Zhixin Yin, Shiwei Chu, Yi-Fan Zhang, Yao Mu, Yuheng Ji, Yihao Wang, Jun Yan, Zhongyuan Wang, Pengwei Wang, Xiaolong Zheng
任务设定
对机器人操作过程进行细粒度评估
痛点动机
现有评估只看成功率,忽略执行过程质量
解决方案
将 rollout 视频转为进度曲线,提出多个过程级细粒度指标
4
Hongsong Wang, Pengbo Yan, Yang Zhang, Qiuxia Lai
任务设定
基于早期骨骼序列预判未见动作类别
痛点动机
传统骨骼动作预判假设类别全见,难泛化新动作
解决方案
提出互信息最大化模块,对齐局部骨骼特征与语义嵌入实现零样本预判
5
Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo
任务设定
统一 3D 重建、稠密对应与空间推理任务
痛点动机
各任务独立建模,限制了跨任务知识迁移
解决方案
提出统一多模态生成框架,将各任务转为指令条件生成,联合建模稀疏与稠密输出
6
Xiaodi Huang, Ziyi Ding, Jingtian Wan, Yuchen Liu, Yuan Zhang, Xiao-Ping Zhang, Jiayu Chen, Zhang Zhang, Tao Huang
任务设定
视觉世界模型中候选动作序列的排序与规划
痛点动机
仅靠终点距离评分,忽略轨迹中间过程信息
解决方案
提出隐空间轨迹代价 (LTC),结合终点距离联合用于训练与规划打分
7
Yi Ding, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang
任务设定
为 VLA 机器人模型引入工具调用能力
痛点动机
端到端动作空间复杂,泛化差且依赖大量数据
解决方案
提出 ART 框架,让 VLA 调用视觉、可供性等外部工具模块,降低动作空间复杂度并提升泛化与数据效率
8
Zhiyue Zhao, Jingyi Wu, Hairuo Liu, Mingyu Liu, Liyang Li, Hengdi Zhang, Tong He, Zhengxue Cheng
任务设定
从人类演示中学习灵巧操作策略
痛点动机
机器人演示数据昂贵,跨本体动作空间不一致
解决方案
提出 AdvDex 框架,用关节对齐动作空间统一人手与机械手,并用对抗学习消除本体外观差异实现跨本体泛化
9
Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam
任务设定
动作条件视频世界模型的少步交互式生成
痛点动机
因果蒸馏难兼顾低延迟生成与键鼠动作对齐
解决方案
提出 ForgeWM ,通过渐进式因果训练与蒸馏,将双向生成器转为 1-4 步的少步世界模型
10
Dinh Tuan Nguyen, Anh Dao, Phuong Nam Dang, Quan-Dung Pham, Tuyen P. Le, Truong Nguyen, Quan Nguyen
任务设定
开放词汇语言引导导航中的物体记忆构建
痛点动机
场景图过早融合特征/标签,易丢弃少数关键线索
解决方案
提出证据保留物体记忆,保留观测级短语与可靠性线索,任务时按需读出定位目标
11
Yiwei Liu, Luwei Yang
任务设定
具身智能体在语言指令下的目标消歧任务
痛点动机
遮挡、视角受限等物理因素也会造成目标歧义,仅靠提问不够
解决方案
提出主动感知框架,用 VLM 决策观察/澄清/选择目标,真实机器人验证