Daily Paper Feed

2026 年 08 月 12 日 星期三 · 共 23 篇相关论文 · 全部存档
1

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang
任务设定 数据稀缺下的手术机器人操作策略学习
痛点动机 动作标注的手术演示数据稀缺昂贵,内窥镜视频相对丰富
解决方案 提出世界-动作模型,先用无动作视频预训练场景动态,再微调实现手术闭环控制
2

Capturing Uncertainty in Human Motion for Representation Learning in Soccer

Yizhou Xu, Lars Bretzner, Tiesheng Wang, Atsuto Maki
任务设定 足球运动员 3D 骨骼运动的自监督表征学习
痛点动机 人体未来运动存在多种可能,需显式建模不确定性
解决方案 提出条件模块建模未来运动概率分布,用离散化多模态轨迹监督学习
3

CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting

Jiayu Ding, Meilu Song, Yun Chen, Wei Gao, Ge Li
任务设定 3D 高斯泼溅场景中的隐式意图推理式分割
痛点动机 现有方法仅处理显式查询,难以理解隐式意图与常识推理
解决方案 结合视觉语言模型3D 场景图,解耦显式感知与隐式逻辑推理
4

HUI360: A 360° Egocentric Dataset and Baselines for Human-Robot Interaction Anticipation

Raphael Lorenzo-Louis, Fabio Amadio, Bertrand Luvison, Serena Ivaldi
任务设定 机器人第一视角下预判人机交互行为
痛点动机 机器人需提前感知人类意图才能主动响应
解决方案 发布大规模 360 度自我中心数据集 HUI360,含姿态/面部关键点/分割标注,并给出交互预测基线
5

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang
任务设定 长时自我中心视频中的物体级问答
痛点动机 现有记忆方法难以保持物体身份和结构化空间变化
解决方案 提出相对 4D 场景图记忆,分离稳定锚点与动态物体,构建可检索记忆支持长时问答
6

ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes

Xinrui Lin, Sha Zhang, Shumin Wang, Zenghuan Zhu, Jiajun Deng, Yanyong Zhang
任务设定 按语言指令在杂乱 3D 场景中定位可交互功能区域
痛点动机 现有方法易漏检交互区域,且相似物体易被指令混淆
解决方案 解耦可供性候选生成与指令推理,用 think-then-answer 视觉提示推理并结合 GRPO 对齐 3D 定位
7

GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes

Ermanno Bartoli, Buwei He, Dennis Rotondi, Sebastian Koch, Federico Tombari, Kai O. Arras, Patric Jensfelt, Yixi Cai, Iolanda Leite
任务设定 面向动态场景的人-物交互时空记忆与推理
痛点动机 现有 4D 场景图保留物体历史却缺活动结构,难支持长时推理
解决方案 构建 4D 场景图+两级人-物交互/事件记忆,配合工具调用代理做时空查询
8

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox
任务设定 灵巧双臂机器人操作的世界-动作联合建模
痛点动机 现有世界-动作模型只预测 RGB 像素,缺 3D 几何与语义监督
解决方案 发现视频生成 VAE 天然编码 3D 点云,联合 RGB、几何、DINO 语义训练混合 Transformer 策略
9

The GENEA Challenge 2026: A Large-Scale Disentangled Evaluation of Speech-Driven Gesture Generation on the Seamless Interaction Dataset

Rajmund Nagy, Silvia Arellano García, Hendric Voss, Mihail Tsakov, Taras Kucherenko, Youngwoo Yoon, Gustav Eje Henter
任务设定 语音驱动人体手势生成系统的大规模人工评测
痛点动机 现有评测难剥离运动质量与语音对齐、缺双人交互场景评估
解决方案 基于 Seamless Interaction 双人对话数据集组织评测,新增语义手势生成任务
10

Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models

Zhijie Wu, Kento Kawaharazuka, Kei Okada
任务设定 为 VLA 机器人策略加速推理中的 KV 缓存复用
痛点动机 视觉 token 逐帧重复计算,浪费实时控制算力
解决方案 监测动作 token 的 logit margin 作为置信信号,低于阈值时才触发重新计算,兼顾速度与可靠性
11

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji
任务设定 开放词汇移动操作中的目标定位与抓取
痛点动机 语言、视觉、3D 结构与动作可行性难以对齐
解决方案 语义 3DGS 作为共享接口,融合可达性定位与扩散 VLA 策略提升抓取鲁棒性
12

Beyond Pixels: From Video Priors to 4D Worlds

Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang
任务设定 根据文本/图像条件生成动态 3D 场景( 4D 生成)
痛点动机 现有方法重建 RGB 易误差传播,或绑定特定视频生成器
解决方案 提出 Latent-to-4D ,直接对齐视频隐空间与 4D 解码器网格,跳过 RGB 重建
13

BooST: Bridging Semantics and Motions for Efficient Skill Transfer

Jusuk Lee, Daesol Cho, Jonghun Shin, Seungyeon Yoo, Jonghae Park, Taekbeom Lee, H. Jin Kim
任务设定 机器人技能迁移:融合语义意图与底层运动
痛点动机 现有方法只学到语义或运动之一,泛化弱、下游数据需求大
解决方案 两阶段框架,用跨模态 VQ-VAE 统一语义运动表征,蒸馏为轻量策略快速适应新任务
14

Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

Yuhang Song, Bor-Jiun Lin, Jiaxu Liu, Te-Chuan Chiu, Anh Nguyen, Chun-Yi Lee
任务设定 为 VLM 策略在序列决策任务中高效注入历史上下文
痛点动机 拼接历史帧致注意力计算量剧增、显存消耗过大
解决方案 提出动态上下文适配器,用固定大小压缩记忆连接静态 VLM 与循环策略
15

DSAR: Dual-Stream Autoregressive Modeling of Temporal Cloth Dynamics for Photorealistic Animatable Avatars

Haozhong Xiong, Yao Yu, Yu Zhou, Sidan Du
任务设定 从 RGB 视频重建可动画化的逼真人体虚拟形象
痛点动机 现有方法忽略布料动力学的时间因果性,导致过度平滑或伪影
解决方案 提出双流自回归框架:几何流传播表面位移,状态流融合历史记忆
16

Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models

Li Wenjie, Yash Jangir, Ignacy Stepka, Yash Agarwal, Marion Kipsang, Yonatan Bisk
任务设定 研究 VLA 模型中动作 token 化与语言语义的对齐
痛点动机 纯重建式动作 tokenizer 丢失动作蕴含的语言 grounding 信息
解决方案 提出 SALT ,用冻结 VLM 从量化动作潜变量恢复指令,强化动词语义
17

Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

Yueting Zhu, Yuehao Song, Kaicheng Zhang, Bao Tang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang
任务设定 流式视频生成中在线逐帧预测未来帧,服务于世界建模
痛点动机 推理用特定去噪顺序,训练用多样噪声配置,二者训练-推理不匹配
解决方案 把采样建模为帧索引随机过程,构建从独立采样过渡到推理一致采样的统一训练轨迹
18

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai
任务设定 为 VLM 引入轻量级空间 token 表征,无需额外推理模块
痛点动机 现有空间推理方法依赖额外空间编码器,增加推理成本
解决方案 将 3D 几何和物体属性蒸馏为连续空间 token ,融入思维链提升空间推理
19

FACT: Failure-Aware Causal Training for World-Action Models

Quanquan Peng, Yutong Liang, Rui Yan, Nicklas Hansen, Xiaolong Wang
任务设定 构建能感知失败后果的世界-动作模型( WAM )
痛点动机 现有 WAM 只用成功演示训练,难以预测坏动作的后果
解决方案 以动作为条件预测未来视频与进度,用失败轨迹监督后果,减少幻觉
20

MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text

Ananya Bal, Kartik Sharma, Ethan Lai, Samyak Tiwari, Liza Dahiya, Chaitanya Chawla, Laszlo A. Jeni
任务设定 根据文本生成手部与物体交互动作序列
痛点动机 扩散模型需预设长度,自回归易丢失接触细节
解决方案 掩码自回归 Transformer 结合流匹配,在连续潜空间中解耦生成手物动作,支持变长与补全
21

4D-WAM: 4D Consistent World Modeling for Autonomous Driving

Jiacheng Fu, Yibo Yuan, Meng Tian, Yue Li, Jiangtong Zhu, Jianhua Han, Yueyi Zhang, Jianwu Fang, Jianru Xue, Hang Xu, Zhiwei Xiong
任务设定 自动驾驶中的 4D 一致性世界动作模型
痛点动机 仅用 2D 视频训练的 WAM 缺乏 4D 场景结构理解
解决方案 引入几何基础模型监督生成 4D 一致性损失,并用决策导向的时间步采样强化早期决策阶段
22

LEGO: Leveled Language Gaussian Splatting

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang
任务设定 3D 场景的开放词汇分层语义分割与理解
痛点动机 2D SAM 分割受视角限制,跨视图粒度不一致
解决方案 基于 3D 高斯泼溅融合多视角 SAM 分割为统一层级结构,结合 CLIP 实现开放词汇分割与场景图推理
23

Navigating the Proximity-Safety Balance: Constraint Decomposition for Human Following in Pedestrian Crowds

Shiting Gong, Jianpeng Yao, Jinfeng Wang, Marco Pavone, Jiachen Li
任务设定 拥挤人群中机器人跟随目标行人的导航任务
痛点动机 贴近目标与安全避障存在天然冲突,权衡难调
解决方案 多约束强化学习将跟随分解为稀疏奖励与独立代价约束,并引入行人运动不确定性提升安全性