Daily Paper Feed

2026 年 07 月 24 日 星期五 · 共 14 篇相关论文 · 全部存档
1

Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le
任务设定 超市场景人形机器人补货任务的 VLA 落地部署
痛点动机 实验室 VLA 模型难应对真实门店的执行误差与环境变化
解决方案 提出数据高效后训练流程结合经验驱动强化优化,基于 GR00T N1.6 ,单 GPU 即可适配真实场景
2

Evolving Cache Schedules for Fast Diffusion Policy Inference

Siying Wang, Kangye Ji, Di Wang, Fei Cheng
任务设定 加速扩散策略在机器人操控中的推理速度
痛点动机 逐步去噪计算量大,现有缓存策略均匀分配导致效率次优
解决方案 进化搜索为不同网络块自动分配缓存复用调度,免训练下最高提速 8 倍
3

PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving

Yushan Liu, Tianxiong Lv, Bohua Wang, Hangqi Fan, Chenxu Zhao, He Zheng, Xuchang Zhong, Yifan Xie, Congyang Zhao, Zhihao Liao, Leigang Luo, Yang Cai, Xiao-Ping Zhang, Wenbo Ding
任务设定 端到端自动驾驶的世界-动作模型轨迹规划
痛点动机 冻结感知先验条件接口窄,静态融合无法按场景调整
解决方案 自适应专家路由融合感知先验与视频编码特征, flow-matching 生成轨迹
4

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation

Zejing Rao, Haoxian Zhang, Xiaoqiang Liu, Yiping Meng, Guoxin Zhang, Pengfei Wan, Fan Tang, Tong-Yee Lee
任务设定 流式生成长时长人-物交互(HOI)视频
痛点动机 现有 HOI 视频生成多为离线短视频,难用于实时交互
解决方案 按区块特性做记忆特化训练,扩展长程交互记忆访问
5

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin
任务设定 微调视觉语言模型识别手术器械-组织交互
痛点动机 冻结或全量微调编码器都难以精准定位动作相关区域
解决方案 逆动力学模型建模动作视觉变化,前向世界模型引导编码器聚焦动作区域
6

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness

Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li
任务设定 跨具身场景下的安全视觉导航策略学习
痛点动机 同一视觉观测对不同具身机器人对应动作不同,纯 RL 难以规模化
解决方案 模仿学习框架引入具身几何作为条件 token ,并用高风险样本训练避障能力
7

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li
任务设定 评测具身世界模型生成视频的物理一致性
痛点动机 依赖 IDM 提取动作在分布外场景不稳定,误差难以归因
解决方案 IDM-free 方案:视觉基础模型直接提取 6D 末端位姿,物理仿真中闭环验证
8

Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation

Kwonyoung Ryu, In-Jae Lee, Jonghyun Jin, Hyunjee Lee, Jongmin Lee, Jaesik Park
任务设定 利用视图合成模型传播全景分割标签到新视角
痛点动机 传统方法依赖显式 3D 重建,泛化能力有限
解决方案 复用冻结的视图合成模型,将标签编码后传播至新视角渲染分割,无需微调
9

The World Model Remembers, the Actor Forgets: Dream Rehearsal for Continual Model-Based RL

Gurp Nijjer
任务设定 探究持续强化学习中智能体的遗忘机制来源
痛点动机 Dreamer 类智能体在任务序列训练中出现灾难性遗忘
解决方案 发现世界模型记忆完好而执行器退化,提出基于自生成梦境的自模仿排练方法
10

EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration

Zuhao Ge, Yuchen Zhou, Weitao Zhou, Minglei Li, Xinyu Li, Chao Wu, Hanwen Zhao, Haotian Wang, Zuxuan Wu, Xiaosong Jia, Yu-Gang Jiang
任务设定 让机器人从第一人称人类演示中学习失败恢复
痛点动机 机器人遥操作采集恢复数据成本高、失败模式难覆盖
解决方案 将人类恢复演示对齐到人机共享的修正意图空间,少量机器人数据即可迁移执行
11

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation

Junzhe Wu, Yue Hu, Zeyu Han, Po-Hsun Chang, Yinan Dong, Behrad Rabiei, Maani Ghaffari
任务设定 构建室内外连续导航的具身机器人基准测试
痛点动机 现有基准分离评测室内外导航,忽略真实机器人执行细节
解决方案 提出 NavVerse 物理仿真基准,涵盖多导航任务与可执行机器人接口评估
12

Crowd4D: Scene-Aware Monocular 4D Crowd Reconstruction

Hongbo Kang, Tianyi Zhou, Qingyang Yang, Hongwei Wen, Jing Huang, Yu-Kun Lai, Kun Li
任务设定 从单目视频重建大场景中的 4D 人群运动
痛点动机 深度模糊与复杂地形导致人群重建尺度失准、空间漂移
解决方案 提出场景感知的 4D 人群重建框架,用人-场景交互代理联合优化人群与场景
13

ModPack: An Extensible Teleoperation Interface for Bimanual Mobile Manipulation

Joshua Citron, Renee Zbizika, Zeyi Liu, Shuran Song
任务设定 支持双臂移动操作机器人的遥操作与数据采集
痛点动机 现有系统绑定特定硬件,难以跨平台扩展复用
解决方案 设计模块化背包式遥操作系统,提供力反馈、移动操作等即插即用模块
14

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models

Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov
任务设定 大规模 VLA 模型的强化学习训练
痛点动机 纯 RL 训练成本高,纯离线模仿泛化弱
解决方案 离线数据/参考策略正则化在线 RL ,保持 OOD 泛化的同时训练预算减半