1
Hsiang-Wei Huang, Fu-Chen Chen, Li-Wu Tsao, Cheng-Han Lee, Che-Chun Su, Lu Xia, Ronghui Peng, Jenq-Neng Hwang, Min Sun, Cheng-Hao Kuo
任务设定
具身场景下检索关键帧完成 3D 问答
痛点动机
现有视觉搜索式检索需逐帧遍历,效率低下
解决方案
提出 MemTree3D 记忆树表示场景,支持免遍历式关键帧打分检索
2
Isidoro Tamassia, Lennert De Smet, Giuseppe Marra
任务设定
让世界模型零样本迁移到同一环境的新任务
痛点动机
神经世界模型隐表示与训练任务强绑定,难泛化
解决方案
奖励预测只依赖隐状态中符号化子结构,解耦重建与奖励,实现新奖励零样本适配
3
Javier Aguilar Martín
任务设定
分析代码世界模型在连续控制中的验收可靠性
痛点动机
采样验收易漏检罕见关键模式,规划器被利用后遗憾极大
解决方案
给出漏检概率的解析界与局部化预算理论,并用 LLM 实验验证修复能力
4
Yubo Huang, Sirui Zhao, Xinchen Yao, Zhengye Zhang, Jinyang Huang, Fengqi Cui, Shiwei Wu, Enhong Chen
任务设定
音频驱动的流式数字人实时生成
痛点动机
自强制蒸馏加速时动作易崩溃成静止画面
解决方案
提出 DynaForcing ,用混合强制锚定真实动态、动态奖励正则化和参考扰动抑制崩溃
5
Amir Arsalan Nematollahi, Shayan Ahmadi, Mehdi Tale Masouleh, Ahmad Kalhor
任务设定
用强化学习迭代优化 2D 视觉下的机器人抓取位姿
痛点动机
几何方法生成的初始抓取候选常常失败,成功率低
解决方案
结合关键点物体表示与 DQN 迭代修正抓取,仿真到真实迁移验证有效
6
Jack Boylan, Chris Hokamp
任务设定
研究 JEPA 世界模型训练中的防坍缩机制
痛点动机
现有方法用高斯正则化约束表征几何,可能成为表征瓶颈
解决方案
用逆动力学对比学习(Action-NCE)替代高斯正则化,让潜在转移预测动作来防止编码器坍缩
7
Qijian Tian, Zimeng Wu, Xuhong Wang, Lizhuang Ma, Xin Tan
任务设定
从稀疏多视角图像重建带实例级语义的可指代 3D 场景
痛点动机
现有前馈 3DGS 方法缺乏实例区分,只能做类别级语义查询
解决方案
用实例分组高斯泼溅学习跨视角一致的紧凑实例嵌入,结合场景图推理支持复杂指代表达式分割
8
Kanglei Zhou, Ruizhi Cai, Hubert P. H. Shum, Frederick W. B. Li, Xiaohui Liang
任务设定
基于人体骨骼关节序列进行动作识别
痛点动机
现有方法时空信息隐式耦合,导致各骨骼模态识别效果失衡
解决方案
仿人脑双通路机制提出双路径图卷积网络,分离建模时空线索并动态融合
9
Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae
任务设定
机器人操作策略执行中的实时误差修正
痛点动机
策略微小误差需重训练修正,代价高不适合实时部署
解决方案
提出在线残差策略适配,用轻量反馈模块预测关节空间残差动作,无需改动原策略参数
10
Seoyoung Lee, Neel P. Bhatt, Pranay Samineni, Cong Liu, S P Sharan, Timothy Barclay, Gregory M. Wagner, Daniel Milan, Sandeep Chinchali, Ufuk Topcu, Atlas Wang
任务设定
视觉-语言导航中条件分支指令的诊断评测
痛点动机
现有评测难区分感知、定位、导航、逻辑决策等具体失败原因
解决方案
提出 CondVLN 基准,基于 3D 场景图谓词生成可控条件指令,评估分支选择准确率与条件成功率
11
Youxiang Wang
任务设定
从卷帘快门视频重建可动画的高斯人体化身
痛点动机
逐行曝光使帧内姿态错位,破坏多视角一致性
解决方案
提出按扫描行合成子帧渲染的滚动快门算子,得到清晰可动画的 3D 高斯化身
12
Tiancheng Chen, Sheng Tang, Wenhua Jin, Weiqi Zhang, Juntong Fang, Junsheng Zhou, Zesong Li
任务设定
从单一查询联合重建动态 4D 场景
痛点动机
现有方法逐对处理密集图,计算冗余且特征难复用
解决方案
提出查询条件框架,一次编码多帧片段,解码时通过交叉注意力按需预测对应、深度与场景流
13
Chang Nie, Zhe Liu, Hesheng Wang
任务设定
面向通用机器人学习的智能体中心架构
痛点动机
VLA 模型覆盖范围外的失败需重新训练策略,代价高
解决方案
多模态智能体把演示转为可复用技能块,建技能库与经验记忆免重训适应新任务
14
Perry Dong, Yueru Jia, Chelsea Finn, Dorsa Sadigh
任务设定
结合世界模型与 Q 学习做机器人操作策略学习
痛点动机
在想象轨迹上直接优化策略易产生复合偏差,难扩展到真实机器人
解决方案
提出 QWM :策略只用真实数据训练,测试时用世界模型搜索想象轨迹以选高价值动作
15
Vineet Bhat, Siyi Chen, Alex Zook, Xuning Yang, Stan Birchfield, Valts Blukis, Jonathan Tremblay
任务设定
操作引导的视觉问答:需移开遮挡物才能看到目标
痛点动机
杂乱场景中目标常被遮挡,静态感知 VLM 无法靠动手探索作答
解决方案
提出 PROBE 框架与仿真基准,并用教师蒸馏训练操作高效的 VLM 智能体