Daily Paper Feed

2026 年 08 月 27 日 星期四 · 共 15 篇相关论文 · 全部存档
1

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun Shen, Junwei Liang, Yinghao Xu
任务设定 机器人零样本跨任务操作泛化
痛点动机 新任务需重新训练,语言指令难传达丰富视觉线索
解决方案 提出 Zero-WAM 因果视频-动作模型,以人类视频为上下文提示引导机器人完成新任务
2

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao
任务设定 为单帧 VLA 模型增加时序建模能力
痛点动机 单帧范式无法保留历史观测,空间感知不精确
解决方案 提出 StreamPI 流式框架,用指令锚定时序单元实现跨帧因果建模,不增加新参数
3

$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning

Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei, Zackory Erickson, Aviral Kumar
任务设定 训练 VLM 用自然语言推理指导机器人操作
痛点动机 长时序操作需追踪进度、纠错,纯模仿学习难以泛化
解决方案 提出 方法,先用专家推理轨迹中期训练,再用规则强化学习优化推理指导动作
4

4DGS-WAM: Bridging Past and Future with an Object-Centric World Action Model based on 4D Gaussian Splatting

Yueen Ma, Zenglin Xu, Irwin King
任务设定 构建以物体为中心的 4D 高斯溅射世界动作模型
痛点动机 2D 世界模型缺乏空间结构,重复处理冗余静态背景
解决方案 分离动态物体与静态背景,用策略模型预测动作,世界模型预测其高斯点变换,背景直接复用历史观测
5

Code World Model: Coding Agent as World Brain

Yiwen Chen, Guosheng Lin, Chi Zhang
任务设定 分离世界演化逻辑与视觉渲染的世界模型框架
痛点动机 视频模型只学视觉表象,难维持长期规则一致演化
解决方案 编码智能体作为世界大脑生成代码维护状态,转换为代理视频驱动视频模型渲染画面
6

Leveraging Inter-object Affordances for Efficient Planning in Contact-rich Tasks

Pouya P. Niaz, Justus Piater, Alejandro Agostini
任务设定 面向接触丰富任务的机器人任务与运动规划
痛点动机 传统 TAMP 用简化物体模型,难处理真实物理接触约束
解决方案 VLM 生成物体间可供性约束(抓取/支撑),融入 U-TAMP 提升异质物体操作成功率
7

ConfAL-WM: Confidence-Guided Active Learning for Action-Conditioned World Models

Xiang Liu, Sen Cui, Changshui Zhang
任务设定 对具身智能的动作条件世界模型做后训练优化
痛点动机 模型误差集中于机械臂、物体等局部时空区域,训练效率低
解决方案 引入轻量置信度探针预测密集置信度图,指导数据筛选与局部加权训练
8

A Tendon-Driven Five-Fingered Hand with Distributed Tactile Perception for Dexterous Manipulation

Huayang Chen, Longhui Qin
任务设定 面向人形机器人的灵巧五指手设计与精细操作
痛点动机 复杂操作依赖手的灵巧性与触觉感知能力,二者常难以兼顾
解决方案 采用腱驱动软硬混合结构,指端分布双模态触觉传感器实现抓取与力感知
9

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan, Kaipeng Zhang, Wangbo Zhao, Yang You
任务设定 用游戏开发流程为世界模型提供可验证训练数据
痛点动机 现有空间生成依赖 CLIP 分数等模糊代理奖励,难支撑 RL 训练
解决方案 提出 RLHEV,结合游戏引擎密集验证信号与人类开发反馈做 RL 后训练
10

Pose-Anchored Optical Flow for Low-Latency Human Action Anticipation in Human-Robot Teaming

Lewis de Zoete Grundy, Chris McCarthy, Christopher Fluke
任务设定 人机协作中低延迟的人体动作早期预测
痛点动机 骨架表示细粒度不足,密集光流计算量大难满足实时性
解决方案 提出姿态锚定光流 PoseOFF,在关节局部提取运动特征辅助早期意图理解
11

4DStreamCtrl: Interactive Video Generation with Online 4D Control

Shiqian Li, Chenguo Lin, Zhiguang Liu, Yu Tang, Jiarong Ou, Rui Chen, Yixin Zhu
任务设定 视频生成中相机与物体运动的统一 4D 在线控制
痛点动机 现有方法只能分别控制相机或 2D 轨迹,缺乏 3D 一致的实时流式生成
解决方案 用统一的 3D 点轨迹表示编码运动,蒸馏为可流式生成的因果模型
12

V-Link: Recovering Lost Visual Representations in Action DiT for Vision-Language-Action Models

Yehao Lu, Jiarui Yang, Yuning Su, Yufeng Xie, Yu Zhong, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Zequn Qin, Enyu Li, Xi Li
任务设定 VLA 模型中动作专家缺失细粒度视觉信息
痛点动机 动作专家难获取 VLM 中的 3D 几何与 2D 语义特征,限制精细操作
解决方案 提出 V-Link ,学习空间/语义查询并通过非对称路径注入 Action DiT 增强感知定位
13

Generative Action-Chunk Sampling for Adaptive Stiffness Control in Physical Human-Robot Collaboration

Aoi Otake, Ferdinand Hartmann, Ko Igari, Shingo Murata
任务设定 物理人机协作中自适应调整机器人关节刚度
痛点动机 人类意图不明确时需柔顺配合,意图清晰时需提供有力辅助
解决方案 生成式动作块采样预测多种未来动作,采样方差大小实时调节刚度与阻尼
14

GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model

Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn
任务设定 VLA 模型 具备精细的 3D 空间推理能力用于机器人操作
痛点动机 2D patch token 缺乏几何结构,深度图也难以表达空间信息
解决方案 提出 GaussVLA ,将语义与深度特征提升为 3D 高斯 token ,并结合深度感知思维链推理
15

Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans

Wentao Jiang, Youchen Xie, Haidi Fan, Yajing Chen, Xin Wang, Ye Shi, Jingya Wang
任务设定 数字人的在线协语手势生成,实时交互场景
痛点动机 现有方法依赖离线完整语音,无法满足低延迟实时交互需求
解决方案 因果自回归模型仅凭历史语音流式预测动作,并引入自进化训练闭环