Daily Paper Feed

2026 年 07 月 21 日 星期二 · 共 31 篇相关论文 · 全部存档

Learning Adaptive Safety Margins for Visual Navigation

Junyi Hu, Shuaihang Yuan, Geeta Chandra Raju Bethala, Anthony Tzes, Yi Fang
任务设定 视觉导航中为扩散规划轨迹自适应选安全边界
痛点动机 固定安全边界会导致绕路超时或冒险抄近道
解决方案 情境安全评价器给候选轨迹打分排序,蒸馏为纯感知选择器,可迁移到 Unitree G1 人形机器人

UniETP: Unifying Environments for Generalizable Embodied Task Planning

Peiran Xu, Jiaqi Zheng, Ziyou Wang, Yadong Mu
任务设定 统一多种仿真器评测具身任务规划
痛点动机 各仿真器观测/动作格式不同,难以统一训练评估
解决方案 提出 UniETP 统一接口整合 AI2-THOR 等 4 个仿真器,标准化观测动作空间并自动生成多样任务数据

Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation

Lingfeng Zhang, Zhanguang Zhang, Liheng Ma, Tongtong Cao, Yingxue Zhang
任务设定 视觉语言导航中利用未来观测辅助决策
痛点动机 传统模仿学习只监督下一步动作,忽略未来视觉预测
解决方案 提出 FSC-VLN,训练时用未来视觉隐向量监督当前状态,推理时无需真实未来图像

SAGE: Subgoal-Conditioned Action Generation for Latent World Model Planning

Letian Cheng, Qi Zhang, Yisen Wang
任务设定 世界模型长时程规划中的候选动作生成问题
痛点动机 规划步长增加时,固定候选预算难以覆盖指数级动作空间
解决方案 提出子目标条件化动作生成器,先预测潜在子目标再据此生成候选动作序列,由世界模型评估筛选

Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement

Lingyu Kong, Ruicheng Li, Ruicheng Wang, Sicheng Xu, Chengtang Yao, Jianfeng Xiang, Jiaolong Yang
任务设定 单目几何估计中细节结构(如细长物体)失真问题
痛点动机 2D 参数化解码导致深度不连续处特征混合,细节过平滑
解决方案 提出稀疏体素细化(SSR),将粗点图提升到 3D 稀疏体素壳上按空间邻近性精细化

ConceptTree: Bringing Semantic Transparency to Black-Box Decision Making for Robotic Manipulation

Yongyan Wen, Feifan Liu, Jinyi Chen, Bo An, Peng Liu, Siyuan Li
任务设定 长时程机器人操作中的高层技能选择决策
痛点动机 现有方法把技能选择当黑盒映射,难以监督和干预
解决方案 构建可解释的概念空间,用决策树预测技能,支持逐概念人工修正

PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao
任务设定 让具身智能体依据语言指令预测导航动作
痛点动机 视觉语言对齐、动作空间适配与训练稳定性难以兼顾
解决方案 两阶段训练:Q-Former 做视觉语言对齐,再用 LoRA 微调专家导航轨迹

ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang
任务设定 从单目第一人称视频重建 4D 人体与场景
痛点动机 现有方法依赖预计算轨迹,割裂建模人体与场景且推理慢
解决方案 掩码生成式 Transformer 单前向统一建模 RGB、轨迹、姿态、手部与深度

Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models

Tuan Duong Trinh, Naveed Akhtar, Basim Azam
任务设定 研究推理机制对 VLA 模型抗扰动鲁棒性的影响
痛点动机 直觉认为推理更鲁棒,但缺乏系统性验证与安全信号检验
解决方案 对比无推理、文本 CoT、隐式迭代三类 VLA,在视觉/推理/动作阶段施加扰动测试

CDIS: Cross-Dimensional Class-Agnostic 3D Instance Segmentation via 2D Mask Tracking and 3D-2D Projection Merging

Juno Kim, Hye-Jung Yoon, Yesol Park, Byoung-Tak Zhang
任务设定 机器人场景中的类别无关3D实例分割
痛点动机 逐帧2D掩码投影融合易致物体身份断裂、实例碎片化
解决方案 跨帧2D掩码跟踪并与3D超点关联,构建2D-3D反馈闭环零样本生成一致3D实例

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation

Nabeela Khan, Bowen Wu, Runwu Shi, Benjamin Yen, Takeshi Ashizawa, Carlos Toshinori Ishi, Takashi Minato, Kazuhiro Nakadai
任务设定 手语生成的3D人体动作迁移到人形机器人执行
痛点动机 生成动作存在自碰撞,导致IK无解、碰撞及轨迹不稳定
解决方案 提出SMPL-X碰撞消除模块与VLM引导重定向算法修正失败模式

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning

Ziyi Liu, Grace Zhang
任务设定 小样本示范下的逆强化学习新任务泛化
痛点动机 真实任务变化多样,难以为每种场景收集完整示范
解决方案 提出MPG方法,分解可迁移判别器与邻近引导奖励,复用多任务示范

Seg2Grasp: A Robust Modular Suction Grasping in Bin Picking

Hye-Jung Yoon, Juno Kim, Yesol Park, Jun-Ki Lee, Byoung-Tak Zhang
任务设定 杂乱料箱中的吸盘抓取机器人拣选
痛点动机 端到端学习方法对未知复杂物体易失效
解决方案 模块化流程:Transformer分割掩码、法向量定抓取点、开放词汇分类识别物体

DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation

Yesol Park, Hye-Jung Yoon, Juno Kim, Byoung-Tak Zhang
任务设定 物流拣选场景中未知物体实例分割
痛点动机 纯RGB易过分割、纯深度易欠分割,难应对遮挡堆叠
解决方案 提出可变形注意力RGB-D融合Transformer,并发布拣选数据集OCBD

Direct Clinical Joint Angle Extraction from Parametric Body Model Rotation Matrices

Joey Páolo Kardolus, Daan Hendriks, Jaap Jansen
任务设定 参数化人体模型旋转矩阵直接提取临床关节角度
痛点动机 传统关节角度测量工具慢、贵,且局限于实验室环境
解决方案 跳过逆运动学优化,用小型校准表把模型旋转矩阵映射为临床角度,单摄像头视频实时可用

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang
任务设定 视频中的 3D 场景空间关系推理任务
痛点动机 MLLM 难以从冗余视频观测中稳定聚合空间证据
解决方案 构建几何一致性记忆存储证据,用一致性强化学习提升跨视角稳定性

Predictive Training with Latent Imagination for Visual Quadruped Navigation

Yancheng Zhu, Wanli Ma, Chen Han, Irvin Haozhe Zhan, Bingfeng Qin, Yixin Xu
任务设定 四足机器人在动态环境中的视觉导航避障
痛点动机 现有策略仅凭当前观测,难以预判障碍物短期运动趋势
解决方案 训练时用JEPA 式预测器预测未来隐状态,推理时零成本丢弃,实现零样本 sim-to-real 迁移

Reinforcement Learning: From Algorithms To Foundation Models

Zihan Ding
任务设定 博士论文:研究博弈强化学习与基础模型时代的决策方法
痛点动机 预训练生成模型能为序列决策提供更强的结构化先验
解决方案 构建扩散式世界模型,研究视频生成与交互式世界模型中动作如何影响未来观测

Thinking in Video: Can Video Generators Really Reason About the Real World?

Yongheng Zhang, Guang Yang, Ruihan Hou, Qiguang Chen, Ziang Liu, Xiaolong Liu, Manman Zhang, Yanchao Hao, Zheng Wei, Hao Wu, Libo Qin, Peishan Dai, Yinghui Li, Di Yin, Xing Sun
任务设定 评估视频生成模型能否真正对真实世界做因果推理
痛点动机 现有指标割裂了画面真实感与语义因果逻辑的评测
解决方案 提出双重评测框架 CGDJ,分别检验显式因果感知与隐式生成-预测差距,审查世界模型一致性

STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition

Yuhang Wen, Mengyuan Liu, Zixuan Tang, Junsong Yuan, Sirui Li, Beichen Ding
任务设定 基于骨骼序列识别人机/人人交互动作
痛点动机 骨骼数据缺乏视觉细节,难以捕捉交互线索
解决方案 对比学习对齐骨骼与 RGB 视频特征,推理时仅需骨骼即可保留视觉增强效果

From Perception to Assistance: Open-Vocabulary Shared Autonomy for Robotic Manipulation

Murilo Vinicius da Silva, Ricardo V. Godoy, Juliano Negri, Gustavo J. G. Lahr, Ranulfo Bezerra, Marcelo Becker
任务设定 遥操作机械臂抓取时提供共享自主辅助
痛点动机 纯视觉遥操作难以精确对准目标且易碰撞
解决方案 视觉语言模型定位开放词汇目标,MPC 控制器实时避障并辅助抓取

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang
任务设定 机器人操作中融合多模态扩散策略的动作生成
痛点动机 各模态传感频率、延迟不同,同步融合拖慢高频反馈
解决方案 提出 LAG-Fusion 框架,各模态按自身频率异步提供去噪引导,通过参考系重定基准对齐延迟后融合

HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu
任务设定 多视角手物交互视频与3D运动的联合生成
痛点动机 复杂手部运动和遮挡导致多视角一致性难以保证
解决方案 用统一扩散模型联合建模RGB视频与3D点轨迹,用伪视频对齐几何与2D潜空间

PREFAIL: Identifying Precursors to Failures in Robotic Lift-and-Place Tasks to Improve Task Execution Performance

Zeyu Shangguan, Rajas Chitale, Rutvik Patel, Satyandra K. Gupta, Daniel Seita
任务设定 预测机器人搬运任务中的失败先兆
痛点动机 现有方法对动态动作敏感、依赖已知策略结构
解决方案 分析物体相对载具的运动,提出PREFAIL方法并标注可干预时间数据集

Scene-SAM3D: Multi-View Scene Asset Generation Without Fine-Tuning

Yuqi Zhang, Yadan Luo, Xiangyu Sun, Fengyi Zhang, Zi Huang, Xin Tan
任务设定 从多视角图像生成具身场景的 3D 资产
痛点动机 真实场景遮挡多、视角不一致,单图 3D 生成难泛化
解决方案 免训练框架,用关键视角选择隐空间速度融合整合多视角证据并优化场景布局

PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration

Han Wang, Zijun Wang, Shuoshuo Xue, Rui Cao, Fenjiao Cheng, Xiaodang Liang, Roy Ka-Wei Lee
任务设定 强化学习优化动作条件世界模型的物理与视觉保真度
痛点动机 现有世界模型只靠像素重建损失,难以显式优化物理合理性且泛化差
解决方案 结合 ID 轨迹与噪声驱动的 OOD 动作探索,通过奖励机制显式优化 PAV 目标

Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL

Zhaohui Wang
任务设定 研究基于模型的强化学习中风险信号是否可靠
痛点动机 世界模型不确定性代理与真实碰撞风险负相关,标准安全机制反而失效
解决方案 改用世界反馈信号(雷达余量、碰撞时间、结果监督模型)替代模型内部不确定性

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu
任务设定 评测视频生成模型作为物理世界模型的推理能力
痛点动机 现有基准仅看结果合理性,未验证是否按物理定律推理
解决方案 提出 Apple-π 基准和感知-建模-推演三阶段协议,结合经典力学视频集评测

Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data

Usman M. Khan
任务设定 从真实户外机器人视频学习可迁移的世界模型表征
痛点动机 复杂户外场景视觉多变,JEPA 学习鲁棒动态表征困难
解决方案 引入深度先验监督结合各向同性正则化,学习更鲁棒的潜在动态

xperception -- Making Robotic Grasping Easier

Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi
任务设定 面向工业场景的零样本 6D 位姿估计与抓取
痛点动机 新品上线常需重新采集数据训练,视觉系统缺乏灵活性
解决方案 结合 CAD 模型与DINOv2、GeDi 等基础模型特征,免微调实现毫米级抗遮挡位姿估计

SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval

Yuga Yano, Daiju Kanaoka, Hakaru Tamukoh, Yasutomo Kawanishi
任务设定 面向服务机器人的3D 语言场交互式物体检索
痛点动机 特征压缩致相似物体难辨,且难以处理模糊查询
解决方案 度量学习构建判别且感知歧义的统一特征空间,模糊时主动请求澄清