Daily Paper Feed

2026 年 08 月 19 日 星期三 · 共 15 篇相关论文 · 全部存档
1

Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering

Hsiang-Wei Huang, Fu-Chen Chen, Li-Wu Tsao, Cheng-Han Lee, Che-Chun Su, Lu Xia, Ronghui Peng, Jenq-Neng Hwang, Min Sun, Cheng-Hao Kuo
任务设定 具身场景下检索关键帧完成 3D 问答
痛点动机 现有视觉搜索式检索需逐帧遍历,效率低下
解决方案 提出 MemTree3D 记忆树表示场景,支持免遍历式关键帧打分检索
2

Towards Zero-Shot Task Transfer with Neurosymbolic World Models

Isidoro Tamassia, Lennert De Smet, Giuseppe Marra
任务设定 世界模型零样本迁移到同一环境的新任务
痛点动机 神经世界模型隐表示与训练任务强绑定,难泛化
解决方案 奖励预测只依赖隐状态中符号化子结构,解耦重建与奖励,实现新奖励零样本适配
3

An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models

Javier Aguilar Martín
任务设定 分析代码世界模型在连续控制中的验收可靠性
痛点动机 采样验收易漏检罕见关键模式,规划器被利用后遗憾极大
解决方案 给出漏检概率的解析界与局部化预算理论,并用 LLM 实验验证修复能力
4

DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation

Yubo Huang, Sirui Zhao, Xinchen Yao, Zhengye Zhang, Jinyang Huang, Fengqi Cui, Shiwei Wu, Enhong Chen
任务设定 音频驱动的流式数字人实时生成
痛点动机 自强制蒸馏加速时动作易崩溃成静止画面
解决方案 提出 DynaForcing ,用混合强制锚定真实动态、动态奖励正则化和参考扰动抑制崩溃
5

Iterative Grasp Pose Refinement: A Deep Reinforcement Learning Approach for 2D Vision

Amir Arsalan Nematollahi, Shayan Ahmadi, Mehdi Tale Masouleh, Ahmad Kalhor
任务设定 强化学习迭代优化 2D 视觉下的机器人抓取位姿
痛点动机 几何方法生成的初始抓取候选常常失败,成功率低
解决方案 结合关键点物体表示DQN 迭代修正抓取,仿真到真实迁移验证有效
6

No Gaussian Required: Contrastive Inverse Dynamics for JEPA World Models

Jack Boylan, Chris Hokamp
任务设定 研究 JEPA 世界模型训练中的防坍缩机制
痛点动机 现有方法用高斯正则化约束表征几何,可能成为表征瓶颈
解决方案 逆动力学对比学习(Action-NCE)替代高斯正则化,让潜在转移预测动作来防止编码器坍缩
7

GroupForward: Building Referable 3D Scenes via Instance-Grouped Feed-Forward Gaussian Splatting

Qijian Tian, Zimeng Wu, Xuhong Wang, Lizhuang Ma, Xin Tan
任务设定 从稀疏多视角图像重建带实例级语义的可指代 3D 场景
痛点动机 现有前馈 3DGS 方法缺乏实例区分,只能做类别级语义查询
解决方案 实例分组高斯泼溅学习跨视角一致的紧凑实例嵌入,结合场景图推理支持复杂指代表达式分割
8

NeuroPath: Brain-Inspired Dual-Pathway Graph Convolutional Networks for Skeleton-Based Action Recognition

Kanglei Zhou, Ruizhi Cai, Hubert P. H. Shum, Frederick W. B. Li, Xiaohui Liang
任务设定 基于人体骨骼关节序列进行动作识别
痛点动机 现有方法时空信息隐式耦合,导致各骨骼模态识别效果失衡
解决方案 仿人脑双通路机制提出双路径图卷积网络,分离建模时空线索并动态融合
9

ORPA: Online Residual Policy Adaptation for Robot Manipulation Control with Human Feedback

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae
任务设定 机器人操作策略执行中的实时误差修正
痛点动机 策略微小误差需重训练修正,代价高不适合实时部署
解决方案 提出在线残差策略适配,用轻量反馈模块预测关节空间残差动作,无需改动原策略参数
10

If, Then, Otherwise: Diagnosing Conditional Branching in Vision-Language Navigation

Seoyoung Lee, Neel P. Bhatt, Pranay Samineni, Cong Liu, S P Sharan, Timothy Barclay, Gregory M. Wagner, Daniel Milan, Sandeep Chinchali, Ufuk Topcu, Atlas Wang
任务设定 视觉-语言导航中条件分支指令的诊断评测
痛点动机 现有评测难区分感知、定位、导航、逻辑决策等具体失败原因
解决方案 提出 CondVLN 基准,基于 3D 场景图谓词生成可控条件指令,评估分支选择准确率与条件成功率
11

Scanline-Aware Animatable Gaussian Avatars from Rolling-Shutter Videos

Youxiang Wang
任务设定 卷帘快门视频重建可动画的高斯人体化身
痛点动机 逐行曝光使帧内姿态错位,破坏多视角一致性
解决方案 提出按扫描行合成子帧渲染的滚动快门算子,得到清晰可动画的 3D 高斯化身
12

UniQuery4R: Unified 4D Scene Reconstruction from a Single Query

Tiancheng Chen, Sheng Tang, Wenhua Jin, Weiqi Zhang, Juntong Fang, Junsheng Zhou, Zesong Li
任务设定 从单一查询联合重建动态 4D 场景
痛点动机 现有方法逐对处理密集图,计算冗余且特征难复用
解决方案 提出查询条件框架,一次编码多帧片段,解码时通过交叉注意力按需预测对应、深度与场景流
13

Teach and Grow: An Agent-Centered Architecture for General Robot Learning

Chang Nie, Zhe Liu, Hesheng Wang
任务设定 面向通用机器人学习的智能体中心架构
痛点动机 VLA 模型覆盖范围外的失败需重新训练策略,代价高
解决方案 多模态智能体把演示转为可复用技能块,建技能库与经验记忆免重训适应新任务
14

Q-Learning With World Models

Perry Dong, Yueru Jia, Chelsea Finn, Dorsa Sadigh
任务设定 结合世界模型与 Q 学习做机器人操作策略学习
痛点动机 在想象轨迹上直接优化策略易产生复合偏差,难扩展到真实机器人
解决方案 提出 QWM :策略只用真实数据训练,测试时用世界模型搜索想象轨迹以选高价值动作
15

PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents

Vineet Bhat, Siyi Chen, Alex Zook, Xuning Yang, Stan Birchfield, Valts Blukis, Jonathan Tremblay
任务设定 操作引导的视觉问答:需移开遮挡物才能看到目标
痛点动机 杂乱场景中目标常被遮挡,静态感知 VLM 无法靠动手探索作答
解决方案 提出 PROBE 框架与仿真基准,并用教师蒸馏训练操作高效的 VLM 智能体