1
Muyao Niu, Jixuan He, Ruihan Yu, Lian Fu, Yonghao Yu, Zheng-Hui Huang, Yifan Zhan, Fengbo Lan, Yongtao Ge, Yinqiang Zheng, Kaipeng Zhang, Zhixiang Wang
任务设定
从多视角视频生成杂乱场景的组合式 3D 表示
痛点动机
密集遮挡场景中物体几何难以完整重建
解决方案
将单物体 3D 生成先验扩展到多视角观测,无需场景级训练即可生成数百物体的复杂场景
2
Linzhan Mou, Jiahui Lei, Zhiyang Dou, Chenyue Cai, Chaoyue Song, Adam Finkelstein, Szymon Rusinkiewicz
任务设定
给定绑定骨骼和文本,生成任意拓扑角色的动作
痛点动机
现有动画模型受限于固定骨骼模板,需逐骨骼微调
解决方案
提出拓扑感知扩散 Transformer ,用图注意力和谱旋转编码统一任意骨骼运动生成
3
Zhenxuan Fan, Bo Zhang, Yutong Lin, Yuqian Yuan, Juekai Lin, Liang Liang, Zhuoyi Huang, Wenqiao Zhang, Juncheng Li, Siliang Tang, Jun Xiao, Yueting Zhuang
任务设定
构建评测 VLA 模型空间推理与长程规划能力的基准
痛点动机
现有基准场景简单、任务短程,难诊断具身推理短板
解决方案
提出 RoboSPA 基准,含 280 种难度变体、52.7 万条轨迹及细粒度诊断指标
4
Chongwen Dong, Mithun Paul Saint-Germain, Pinjari Asif, Carlo R. daCunha
任务设定
分散式多机器人导航中用 LLM 优化策略,避免破坏局部学习
痛点动机
LLM 策略推理与底层控制更新节奏不同步,易导致局部学习不稳定
解决方案
结合 LLM 策略代理、UCB 老虎机选择精化模式,与 Double DQN 执行动作,分层解耦决策
5
Tianle Du, Jie Wang, Xiaolong Xie, Wei Li, Pengxiang Su, Jie Liu
任务设定
利用单目视频重建动态人体并渲染新视角
痛点动机
MLP 容量有限,动态场景训练慢且重建质量受限
解决方案
构建独立于 MLP 的时序残差场,结合多维度损失函数提升精度并大幅加速渲染
6
Zijie Zhu, Weiren Cai, Yizhou Wang, Zhenjie Yang, Yide Liu, Jiahao Chen, Guanqi He
任务设定
从第一人称视频估计相机与双手世界坐标运动
痛点动机
现有方法分阶段处理相机、深度、手部,开销大且无法联合建模
解决方案
提出统一基础模型,从共享时空表征联合预测相机轨迹与手部状态并转换到世界坐标;大规模伪标签预训练后精调
7
Xin Zhang, Yabo Chen, Zixuan Duan, Haibin Huang, Chi Zhang, Feng Xu, Xuelong Li
任务设定
基于单张图像构建可交互的物理世界模型
痛点动机
现有视频世界模型偏重外观先验,长时序易失去物理一致性
解决方案
结合确定性物理仿真与视频生成,分离仿真状态、几何证据与外观记忆,支持持续探索与操作
8
Yihan Zhou, Zikai Huang, Yuyang Yu, Xuemiao Xu, Cheng Xu, Shengfeng He
任务设定
生成双人对唱的 3D 头部动画
痛点动机
对唱互动稀疏且依赖节奏,现有音频驱动动画方法难以建模
解决方案
提出交互 logits 表示互动强弱,条件化扩散模型联合音频与互动信号生成动画
9
Yusuke Oumi, Yuto Shibata, Go Irie, Akisato Kimura, Yoshimitsu Aoki, Mariko Isogawa
任务设定
仅用声学信号估计多人 3D 姿态
痛点动机
多人声学信号相互叠加,难以区分个体运动特征
解决方案
提出 SoundMHPE 框架,多尺度声学编码器提特征,注意力解耦多人信息逐帧重建姿态
10
Tianyidan Xie, Shenyi Wang, Qiang Tang, Mingjie Wang, Zhicheng Qiu, Xuanfu Li, Zhan Xu, Jian Yang, Lanjun Wang, Zili Yi
任务设定
具身智能体长时序动态物体空间记忆检索
痛点动机
现有记忆丢失运动细节或无法语言查询
解决方案
提出语言化轨迹编码,融合语言描述、空间与视觉锚点压缩运动轨迹
11
Tsung-Chih Chiang, Hsuan-Kung Yang, Jou-Min Liu, Ting-Ru Liu, Chun-Wei Huang, Quan Kong, Chun-Yi Lee
任务设定
基于 VLM 的 3D 视觉定位,需挑选关键相机视角
痛点动机
现有方法靠启发式选视角,未考虑与定位相关性
解决方案
训练视角选择器预测查询相关视角,交给 VLM 比较定位
12
Mahir Majid, Young Kyung Kim, Guillermo Sapiro
任务设定
评估场景中人物多视角图像生成的空间一致性
痛点动机
相机转动时头部朝向与背景常出现幻觉、不一致
解决方案
提出 HSRD 指标,解耦相机运动与头部姿态,量化 3D 视差一致性
13
Amarjot Singh, Tanmay R. Pancholi, Jainam Kothari, Shrirang Mahajan, Ketan Bansal, Zackory Erickson, Giuseppe Loianno, Alexandre M. Bayen, Jeff Schneider, Vince Nakayama
任务设定
面向部署后具身智能体的持续在线适应与技能学习
痛点动机
现场数据稀缺、仅有机载算力,还要不遗忘已有能力
解决方案
提出 CFAM 架构,慢速核心+快速 Capsule Field ,实现跨机械臂、四足、人形等本体的少样本持续学习
14
Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt
任务设定
机器人实时识别人类社交手势与意图
痛点动机
遮挡、视角变化和低延迟约束下手势感知很困难
解决方案
用置信度感知骨骼表征融合身体与手部动作,配合遮挡增强训练提升边缘端实时鲁棒性
15
Jose Luis Ponton, Alexander Winkler, Ladislav Kavan, Yuting Ye, Petr Kadlecek
任务设定
用少样本实现虚拟角色的运动风格迁移
痛点动机
现有方法依赖大量风格化数据或泛化能力差
解决方案
将风格拆解为静态姿态与时序动态两部分,几分钟内训练完成并支持运行时可控调节
16
Chenyu Su, Zhaolong Shen, Yuan Qian, Chen Qian, Rui Zhang, Feng Yan, Weixing Chen, Fei Zhang, Jiamin Wang, Shuang Cong, Weiwei Shang
任务设定
真实场景中对 VLA 模型做在线强化学习微调
痛点动机
价值信号不稳、大模型开销高,精度和可重复性受限
解决方案
提出非对称协同自举算法与 ACoB-Stream 流式架构,抑制策略漂移并大幅提升吞吐
17
Jie Ma, Zongxi Liu, Yi Zhu
任务设定
面向 VLA 机器人操作策略的时间戳级失败检测
痛点动机
轨迹级标签把失败前正常行为误标,导致定位不准
解决方案
用动作弱监督信号捕捉异常模式,配合主动学习挑选样本标注微调
18
Chengqian Ma, Wei Tao, Haoyu Zhang, Yiwen Guo
任务设定
端到端联合生成语音与全身动作的对话数字人
痛点动机
传统级联方案语音动作分离,二次推理且无法联合优化
解决方案
对话大模型直接从隐藏状态同步输出语音与全身动作,联合训练保持对齐