Daily Paper Feed

2026 年 09 月 18 日 星期五 · 共 40 篇相关论文 · 全部存档
1

Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation

Bingxin Xu, Yuzhang Shang, Zhen Dong, Emilio Ferrara
任务设定 让代码智能体安全完成机器人操作任务
痛点动机 智能体只顾达成目标,规划时常忽略避障约束
解决方案 提出 SafeHarness ,规划避障路径并感知接触阶段的安全约束
2

Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision

Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz
任务设定 长时程机器人操作任务的记忆表示
痛点动机 全历史条件化易致虚假关联,在线 VLM 查询代价高
解决方案 训练期用 VLM 蒸馏出轻量 workspace token ,部署时替代观测
3

Can 4D Foundation Models Remember?

Guangzhao He, Hadar Averbuch-Elor, Wei-Chiu Ma
任务设定 评测 4D 基础模型对动态场景的记忆能力
痛点动机 现有基准缺乏物体离开视野后的真值,难以评估记忆
解决方案 提出 PersistBench ,用 360° 视频作全知真值评测物体恒常性等
4

GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies

Xin Chen, Sen Chen, Yujuan Ding, Jian Liu, Guoqing Wang, Wei Ye, Heng Tao Shen, Yi Bin
任务设定 VLA 策略中动作分块长度的自适应选择
痛点动机 固定动作视野无法适配任务各阶段变化的控制需求
解决方案 Flow Matching 去噪轨迹几何特征衡量预测可靠性,自适应调整动作视野
5

FunArt: Decoding Functional Structure and Articulation from Generative 3D Latents

Dennis Rotondi, Abdelrhman Werby, Kai O. Arras
任务设定 从单次静态 RGB-D 扫描恢复可动物体的关节结构与功能部件
痛点动机 现有方法难以同时兼顾运动学恢复与功能交互部件分割
解决方案 复用 TRELLIS.2 生成式 3D 隐空间先验,轻量解码器联合估计运动轴并分割功能部件
6

Learning Foresight without Explicit Trajectories for 3D Diffusion Policies

Zhongbo Zhang, Zaibin Zhang, Yifan Wang, Changbo Yan, Lijun Wang, Huchuan Lu
任务设定 3D 扩散策略具备对未来交互趋势的预见能力
痛点动机 现有策略仅隐式学习运动可行性,缺乏对交互走向的预判
解决方案 从历史观测学习潜在运动趋势,仅作条件引导扩散策略生成,不显式规划轨迹
7

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong
任务设定 无需机器人在环的 VLA 模型人机协同后训练
痛点动机 静态数据覆盖有限,标准模仿学习难辨优质行为
解决方案 UMI 手持采集对比策略推理触发数据采集,结合优势估计做行为克隆
8

DexTouch-WM: Learning Action-Conditioned Tactile World Models from Human Touch for Dexterous Robot Manipulation

Yan Qin, Yue Chen, Wenwei Lin, Shujia Liu, Chuqiao Lyu, Kailun Su, Chenze Yu, Ping Luo, Wenbo Ding, Tianxing Chen, Renjing Xu
任务设定 学习触觉世界模型用于灵巧机器人操作预测
痛点动机 机器人接触式交互数据采集昂贵,难以规模化
解决方案 用人手佩戴压阻触觉阵列采集数据,动作重定向后联合训练视触觉世界模型
9

PROVIA: Procedure State Tracking for Online Mistake Detection in Egocentric Videos

Di Wen, Kailun Yang, Jimmy Weissert, Luc Maria Scherrer, Cedric Zöllner, Ruiping Liu, Yufan Chen, Jiale Wei, Junwei Zheng, Kunyu Peng
任务设定 第一视角视频中在线检测操作步骤错误
痛点动机 现有方法仅截取到首次错误处评估,难应对完整真实流程
解决方案 跟踪流程状态与执行进度的贝叶斯后验,序列检验触发错误告警
10

INSPECT: Learning Robot View Selection from Assistant Use

Di Wen, Kailun Yang, Wenhao Guo, Yitian Shi, Junwei Zheng, Yufan Chen, Ruiping Liu, Jiale Wei, Rania Rayyes, Kunyu Peng
任务设定 机器人学习为装配检查选择最佳观察视角
痛点动机 缺乏目标域视角标注,难以直接训练视角选择策略
解决方案 智能眼镜助手问答记录中学习视角偏好,无需候选图像即可选视角
11

CoRef-GS: Cooperative Referring Gaussian Splatting for Multi-Agent Scene Understanding

Zhikun Zhou, Kunyu Peng, Runyi Yang, Junhao Cai, Di Wen, Ruiping Liu, Danda Pani Paudel, Yi Zhou, Luc Van Gool, Kailun Yang
任务设定 多机器人协同场景下的语言指代目标定位
痛点动机 融合地图后需保持跨智能体语义一致性与视角相关关系推理
解决方案 构建开放词汇实例级高斯地图,跨机器人对齐后用视角条件关系图做指代定位
12

Accelerating Visual Policy Learning with Sampling-Based Model Predictive Control

Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham
任务设定 学习四足/人形机器人的视觉运动与操作策略
痛点动机 纯一阶策略梯度易陷入错误接触模式局部最优
解决方案 采样式 MPC 优化与一阶策略梯度交替训练,实现深度视觉策略零样本迁移到真实机器人
13

OmniMimic: Dynamics-completed Motion Augmentation for Multi-style Omnidirectional Quadruped Locomotion

Sheng Wu, Guoqiang Zhao, Zhe Yang, Fei Teng, Zhikun Zhou, Yanlin Yang, Zheng Fang, Hong Zheng, Yaonan Wang, Kailun Yang
任务设定 用动物示范训练全向多步态四足机器人
痛点动机 示范方向单一,侧向/倒退/转向缺乏一致性监督
解决方案 通过动力学补全与镜像/时间反转扩增数据,结合门控专家网络统一多步态策略
14

SenseFuse: Label-Free Fusion of Image and Shape Encoders for Open-Vocabulary 3D Instance Segmentation

Euiseok Han, Tri Ton, Hwanhee Kim, Seungyeon Ryu, Chang D. Yoo
任务设定 面向机器人的开放词表 3D 实例分割任务
痛点动机 现有方法仅依赖 2D 图像特征,未充分利用 3D 形状信息
解决方案 无标签融合 2D 图像编码器3D 形状编码器,自适应选权重提升标注质量
15

TouchSight: Bare-Handed Tactile Prediction from Egocentric Video via Generative Visual Augmentation

Danyan Zhou, Jinxuan Lu, Jiawei Lin, Tianxing Chen, Chuqiao Lyu, Wenbo Ding
任务设定 第一视角视频预测赤手的密集接触力
痛点动机 触觉数据需接触式手套采集,规模化和裸手泛化困难
解决方案 用 500 小时手套数据训练,并靠生成式视频模型把手套画面转成裸手图像做数据增强
16

Navi-Agent: Unlocalized Monocular Navigation Agent

Wenyuan Xie, Mengyang Hong, Yongzhong Wang, Yanbiao Ji, Yijin Zhou, Shaokai Wu, Shalayiding Sirejiding, Huayi Zhou, Yi-Chao Chen, Ma Ling, Yue Ding, Hongtao Lu
任务设定 连续环境下的零样本视觉语言导航( VLN-CE )
痛点动机 去几何定位后,长时空间状态维持与错误恢复困难
解决方案 构建无坐标拓扑图,用视觉观测做自定位、进度校验与回溯纠错
17

MM-Future: Multi-Mode Joint World-Action Modeling for Autonomous Driving

Shuai Liu, Hechangle Gong, Hao Jiang, Runlin He, Junxiang Zhan, Kai Huang, Sheng Yang, Shaoqing Ren
任务设定 自动驾驶中的世界-动作联合建模与轨迹规划
痛点动机 决策与场景演化存在多模态耦合的不确定性,单模式建模不够
解决方案 扩散 Transformer 生成多组场景-动作假设并双向协同演化,再据未来预测打分排序
18

AnyviewMeter: Adapting Robotic Reward Models with Camera Geometry and Multi-View Attention

Yuang Tu, Runjia Tan, Yujie Yan, Jinghan Hu, Chen Lv
任务设定 机器人奖励模型适配不同相机视角与遮挡
痛点动机 视角/遮挡变化会使奖励预测漂移,即使任务状态未变
解决方案 Plucker 射线编码相机几何,配合 LoRA 微调与多视角注意力融合观测
19

MAGMA-GEN: Validated Recovery Supervision from Ambiguous Failures via Counterfactual Re-Execution

Loan Bernat, Matthieu Grard, Ariane Herbulot, Florent Lamiraux
任务设定 分层机器人长时程操作生成失败恢复监督数据
痛点动机 失败轨迹存在歧义性,常规监督/强化学习均难利用
解决方案 特权教练诊断错误并提出恢复动作,仅保留重执行验证确实改善的样本作监督
20

Astronex-World 1.0: Real-Time Interactive World Model Foundation

Xin Zhou, Cong Miao
任务设定 构建实时可控的视频世界模型基础架构
痛点动机 现有世界模型难兼顾实时流式生成与相机/动作可控性
解决方案 块因果注意力+KV 缓存实现流式生成,PRoPE 编码相机位姿并用动作流逐层调制
21

GRF-Recon: Global Ray-Field Optimization for Long-Sequence Feed-forward Reconstruction

Enpeng Li, Yunzhou Zhang, Zhiyao Zhang, Dexuan Lyu, Chenyu Wang, Chiyuan Cui, Cheng Cheng
任务设定 长单目序列的前馈式 3D 重建
痛点动机 长轨迹易漂移且局部几何质量差,难保持全局一致性
解决方案 LoRA 蒸馏单目几何先验,结合稀疏光线场优化保证跨帧一致并减少漂移
22

MaskHarness-WAM: Instance-Grounded Harnessing for Long-Horizon Robot Manipulation

Zitai Huang, Taiyi Su, Jian Zhu, Jianjun Zhang, Chong Ma, Tianbin Liu, Weiyi Lu, Yi Xu, Hanli Wang
任务设定 长时程机器人操作中的实例级目标跟踪与调度
痛点动机 多个外观相同物体需按序操作时,低层策略难判断该动哪个、何时切换
解决方案 目标掩码连接高层任务规划与低层操作策略,视觉反馈验证子任务完成状态并更新目标
23

DirtyMoCap: Robust Motion Capture from Unconstrained Markers

Long Wang, Shuting Zhao, Shen Yan, Siyuan Yu, Xiaoben Li, Zeyu Cai, Yumeng Hou, Yuliang Xiu
任务设定 无序、嘈杂的动捕标记点恢复人体全身运动
痛点动机 传统光学动捕依赖固定标记布局,实际中标记稀疏、噪声大且布局多变
解决方案 将标记映射到固定的代理锚点,再用可微分高斯-牛顿求解器拟合 SMPL-H 模型
24

Learning and Transferring Closed-Loop Robot Software

So Kuroki, Yujin Tang
任务设定 生成并迁移闭环机器人策略代码到新任务
痛点动机 手写带分支判断的闭环策略代价高,难泛化
解决方案 编程智能体从演示生成策略代码,靠仿真反馈迭代优化并归档复用
25

BinoGen: Scaling egocentric binocular data for embodied visual perception and learning

Chunpeng Li, Ya-tang Li
任务设定 自动合成大规模自我中心双目视觉数据
痛点动机 真实世界双目自我中心数据采集标注成本极高
解决方案 程序化场景合成生成双目视频及深度、光流等多模态标注,提升真实感知效果
26

SlugTrails: An Egocentric Benchmark for Floor Plan Localization in Large Buildings

Yunqian Cheng, Roberto Manduchi
任务设定 大型建筑内自我中心视觉楼层平面定位评测
痛点动机 现有方法多针对小型住宅,难泛化到大型公共建筑
解决方案 Aria 眼镜采集多栋校园建筑数据并标注,微调后定位精度大幅提升
27

Feeling Terrain Before Crossing: World Models for Off-Road Navigation

E-In Son, Dong-Wook Kim, Ji-Hoon Hwang, Kangsun Lee, Jisung Bae, Jung-Taak Kim, Seung-Woo Seo
任务设定 越野导航世界模型预测机器人触地体感
痛点动机 越野场景仅预测画面不够,需预知打滑颠簸风险
解决方案 引入本体感觉联合视觉预测未来状态与失败风险,规划时主动避开危险地形
28

Improving Cross-embodiment Transfer in Latent Action Models with Action-Similarity Supervision

Maxime Alvarez, Renzo Caballero, Tatsuya Matsushima, Yusuke Iwasawa, Yutaka Matsuo
任务设定 潜在动作模型的跨机器人形态策略迁移
痛点动机 不同机器人执行同一动作时潜变量表示不一致
解决方案 动作相似度监督对齐潜在动作空间,无需预测真实动作即可提升跨形态泛化
29

SnapPhysics: A Physics-Aware Scene Graph from a Single View for Interactive Mixed Reality Scenes

Suji Kang, Seok-Young Kim, Young Bin Kim, Taewook Ha, Dieter Schmalstieg, Shohei Mori, Woontack Woo
任务设定 从单张图像重建 3D 物体并估计物理属性
痛点动机 视频分析耗时,纯 VLM 推理缺乏几何依据
解决方案 结合实例级 3D 重建物理感知场景图,为 VLM 推理提供结构化上下文
30

AI Smart Glasses for Wearable Intelligence: From Egocentric Sensing to Agentic Personalization

Xu Yuan, Yi Wang, Zhuohang Jiang, Haohao Qu, Yujuan Ding, Shanru Lin, Guoliang Xing, Hongxia Yang, Jiannong Cao, Qing Li, Wenqi Fan
任务设定 综述 AI 智能眼镜从第一人称感知到个性化助理的系统设计
痛点动机 智能眼镜正从拍摄显示设备转向可穿戴 AI 系统,需系统梳理
解决方案 从硬件、具身智能、交互设计、应用场景四维度组织综述
31

Beyond Patch Removal: Persistent Adversarial Effects in Vision-Language-Action Policies

Enhao Wu, Fusen Guo, Yuxin Cao, Ziyang Lyu, Lin Li, Wei Song
任务设定 评估 VLA 策略遭对抗补丁攻击后移除补丁的持续影响
痛点动机 现有评测未区分即时动作破坏与补丁移除后的持续状态影响
解决方案 提出状态恢复协议分离两类效应,并训练恢复适配器提升可恢复性
32

TacSushi: Tactile-Grounded World-Action Modeling for Dexterous Sushi Manipulation

Haodi Hu, Kaen Kogashi, Toshiaki Koike-Akino
任务设定 触觉引导的灵巧机器人寿司操作任务
痛点动机 食物操作存在形变、遮挡与接触不确定性
解决方案 基于 Cosmos3 世界-动作模型,用门控触觉融合结合未来结果监督训练策略
33

VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control

Zhongbo Zhang, Jiayi Jin, Yifan Wang, Zaibin Zhang, Haiwen Diao, Lijun Wang, Huchuan Lu
任务设定 评测具身智能体的主动感知与精细操控能力
痛点动机 现有模型缺乏观察-推理-行动-修正的完整闭环
解决方案 提出 VABench 基准,含单/双臂任务,测试主动视角选择与度量级控制指令
34

ParticleSplat: Self-supervised Object-centric Latent Particle Splatting

Lyuxing He, Daniel Guo, Elizabeth Terveen, Deepak Pathak, David Held, Tal Daniel
任务设定 自监督学习物体中心的 3D 场景表示
痛点动机 2D 隐粒子方法难以支持机器人操作所需的 3D 空间推理
解决方案 结合深度隐粒子前馈 3D 高斯溅射,构建可编辑的 3D 隐粒子空间
35

Predict Before You Deploy: Offline Prediction of Quantization-Induced Task Degradation for World Action Models

Jiuyi Xu, Jinjia Guo, Meida Chen, Jing Du, Yangming Shi
任务设定 预测世界动作模型量化后的任务性能下降
痛点动机 闭环评估量化配置代价高,需离线提前判断
解决方案 用离线动作偏差校准阈值,判断接受、拒绝或延后部署配置
36

From Rollout to Reset: A Graph-Based Harness for Autonomous Long-Horizon Manipulation Evaluation

Jing Jiang, Yue Yang, Xinkai Jiang, Gedas Bertasius, Daniel J. Szafir, Rudolf Lioutikov
任务设定 自动化长时程机器人操作评估中的场景重置
痛点动机 人工重置耗时,现有方法仅支持单步任务
解决方案 场景图规划原子重置技能组合, LLM 负责评分与验证
37

GAVEL: Graph World Models for Verified and Efficient Long-Horizon LLM Task Planning

Ruiyang Wang, Hao-Lun Hsu, Swarajh Mehta, Jiwoo Kim, Zhihao Dou, Miroslav Pajic
任务设定 LLM 长时程机器人任务规划的验证与修复
痛点动机 LLM 生成计划常违反具身约束、难以从错误恢复
解决方案 图世界模型预测动作后果并自动修复错误,仅语义错误才用 LLM 重规划
38

JEPA-WAM: Connecting Generated Visual Instructions to World Action Models through JEPA Latent Representations

Tianbin Liu, Jian Zhu, Taiyi Su, Jianjun Zhang, Chong Ma, Zitai Huang, Yi Xu
任务设定 提升 世界动作模型 对文本指令的跟随能力
痛点动机 视觉-动作轨迹丰富但语言标注稀疏,模型难以真正理解指令语义
解决方案 用文生图生成多样 视觉目标图,经 V-JEPA 编码成目标 token 引导生成
39

Scene-Q: Confidence-Aware Coarse-to-Fine Querying of 3D Scenes with Selective VLM Reasoning

Juno Kim, Yesol Park, Hye-Jung Yoon, Byoung-Tak Zhang
任务设定 室内机器人开放词汇 3D 场景查询与实例分割
痛点动机 余弦相似度检索对相近标签、多实例场景易出错
解决方案 置信度感知由粗到细框架,低置信度查询才调用 VLM 推理重排序
40

SAGE-Yoga: Multi-Cue Learning for Yoga Pose Classification and Joint-Level Correction

Hung Le Chi, Khanh Minh Huynh, Long Nghia Tran Pham, Tan Phuc Huynh, Trong-Thuan Nguyen, Minh-Triet Tran
任务设定 基于单张 RGB 图像的瑜伽姿势分类与关节级纠正
痛点动机 现有方法难辨相似姿势,分类与纠正相互割裂
解决方案 多视觉骨干集成投票,配合几何验证仅在姿势模糊时启用,实现由粗到细分类与关节纠正