Daily Paper Feed

2026 年 08 月 18 日 星期二 · 共 44 篇相关论文 · 全部存档
1

Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory

Bingxin Xu, Yuzhang Shang, Emilio Ferrara
任务设定 长时程机器人多阶段操作任务的规划与执行
痛点动机 VLA 误差随阶段累积,子任务缺乏转移条件导致衔接失败
解决方案 LLM 智能体做高层规划,按子任务探索并用转移感知记忆串联长时程轨迹
2

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu et al. (13 additional authors not shown)
任务设定 评估视频世界模型生成结果是否符合物理规律
痛点动机 现有评测只给分数,缺乏可验证的推理依据
解决方案 引入智能体化评测流程,分解问题并生成可追溯的证据链
3

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang
任务设定 将通用 VLA 模型迁移至人形机器人全身移动操作
痛点动机 全身动作维度高、强耦合,直接在线 RL 微调大模型代价高且有风险
解决方案 HAF-VLA 分阶段生成全身动作, HAF-Steer 用隐空间 RL 低成本微调
4

CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated?

Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan, Benjamin Graham, Jeffrey Hawke
任务设定 评测视频世界模型生成结果的物理统计校准度
痛点动机 现有基准仅看单次生成或粗粒度分布,忽略细粒度随机性是否合理
解决方案 离散化结果空间(如骰子点数)比对参考分布,量化可评分率与校准误差
5

Neurosymbolic Embodied Agents

Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha
任务设定 让智能体完成长时程家庭具身任务并生成可执行计划
痛点动机 视觉语言模型生成的计划常违反环境动态或实体定位错误
解决方案 先用 VLM 视觉探索获取符号初始状态,再用 PDDL 约束解码结合蒙特卡洛树搜索规划
6

FabriMAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy

Aniri, Chen Yilin, Jinhe Bi, Junfei Guo, Donglai Ran, Xu Bian, Zengjie Jin, Yujun Wang, Yijun Tian, Volker Tresp, Fei Shen, Tat-Seng Chua, Yunpu Ma
任务设定 VLA 模型在无监督下自评估动作生成可靠性
痛点动机 现有方法依赖专家标注或仅看输出统计,忽略内部信号
解决方案 提出 MAE 框架,用注意力熵建模马尔可夫链评估可靠性,支持测试时动作筛选
7

Orbit-Planner: Towards Latent World Models for On-Orbit Obstacle Avoidance of Satellite Agents

Zhijian Li, Chao Ren, Peijin Wang, Xian Sun
任务设定 卫星在轨自主避障导航中的碰撞风险预测
痛点动机 传统规划器依赖预定义地图,难以适应动态轨道环境
解决方案 提出两阶段潜在世界模型 Orbit-Planner ,用物理探针从想象轨迹解码物理状态
8

DeepInsight II: One Trace from Benchmark to Robot

Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen
任务设定 统一评估具身智能从仿真基准到真实机器人的表现
痛点动机 评测体系碎片化,仿真与真实差距难以统一衡量
解决方案 提出任务-资源-结果统一框架,用同源追踪连接仿真与真实机器人评测
9

NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation

Cong Zhao, Shuai Tian, Xu Zhang, Baocheng Ni, Xinguo Song, Xueying Sun, Shu Jiang, Shouchang Yang, Bo Tang, Jin Deng, Ge Zhu, YongCheng Wang, Jin Xu, Ri Yang
任务设定 机器人操作中的视觉-语言-动作模型高效控制
痛点动机 现有 VLA 模型效率与性能难以兼顾,跨本体泛化困难
解决方案 双频异步架构解耦推理与控制,统一动作表示提升跨本体泛化与平滑性
10

DriveCache: Action-Aware Caching for Driving World Model Inference

Jianchun Yang, Jian Liang, Xianda Guo, Pinhan Fu, Yanlun Peng, Conglang Zhang, Wenke Huang, Mang Ye
任务设定 加速自动驾驶世界模型的视频生成推理
痛点动机 扩散模型多步去噪评估开销大,限制生成吞吐量
解决方案 利用自车运动轨迹信号,动态规划分配去噪步间的特征复用
11

LaGSplat: Inferring Physics-Governed Interactive Simulation from Monocular Video Using Latent Lagrangian Gaussian Splatting

Louen Pottier
任务设定 从单目视频推断可交互的物理动力学场景
痛点动机 常见解码器无法把图像空间外力回传到运动方程
解决方案 拉格朗日隐变量兼任广义坐标与高斯泼溅条件,实现受力实时仿真
12

GaussianDWM++: Language-Grounded 3D Gaussian Driving World Model for Unified Scene Understanding, Editing, and Multi-Modal Generation

Tianchen Deng, Xuefeng Chen, Shuang Wu, Qu Chen, Jiajun Zhu, Bo Dai, Jianfei Yang, Hesheng Wang
任务设定 基于 3D 高斯 的驾驶场景理解、编辑与生成统一模型
痛点动机 现有驾驶世界模型缺乏显式 3D 理解和语言对齐能力
解决方案 将视觉语言特征蒸馏进 3D 高斯基元,构建可指令编辑的语义场景表示
13

HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction

Jiahao Ji, Ji Ma, Runhan Zhang, Runyi Yu, Wenjia Wang, Weiheng Chi, Qianqian Peng, Weichao Yan, Yongfei Gu, Ye Tian, Ting Wu, Longwei Li, Chun Yuan, Ruoli Dai, Lei Han
任务设定 构建高精度全身人体动作与物体交互大规模数据集
痛点动机 现有数据集要么缺乏物理标注要么行为覆盖窄,制约人形策略学习
解决方案 光学动作捕捉采集 600+ 小时全身动作,提供亚毫米级标记与物体网格轨迹
14

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

Tao Feng, Xu Li, Xiangyang Luo, Ming Wen, Huadai Liu, Chen Zhang, Wei Xue
任务设定 根据参考图像、文本和音频生成边唱边跳的人物视频
痛点动机 现有方法难以同时处理演唱口型与舞蹈动作生成
解决方案 提出角色感知音频条件扩散框架,实现零样本组合式歌舞生成
15

Trajectory-Level Automatic Curriculum Learning for Legged Locomotion on Unstructured Terrain

Rocky Liu, Tengyu Liu, Baoxiong Jia, Fangwei Zhong, Xinyi Tong, Hongzhao Xie, Siyuan Huang
任务设定 复杂非结构化地形上训练腿式机器人运动策略
痛点动机 地形难度无法预先定义,人工课程设计难以泛化
解决方案 提出轨迹级自动课程学习,动态学习难度函数生成训练轨迹课程
16

Beyond Similarity Matching: Structured Reasoning for Open-Vocabulary Referring Segmentation in 3DGS

Yizhao Wang, Xinfa Wang, Jingbo Wang, Jingbo Wang, Guantao Zhang, Yafeng Han, Guohong Gao, Yuhe Xia
任务设定 3DGS 场景中的开放词汇指代分割
痛点动机 全局文本-区域相似度难应对属性、空间关系等复杂表达
解决方案 提出 QAGaussian ,用查询自适应高斯槽及关系图做结构化推理
17

US-VLA: An Ultrasound Vision-Language-Action Model for Embodied Abdomina

Cheng Zhang, Xingzheng Wu, Guihao Yan, Xifeng Hu, Zhi Liu, Mei Wu, Qing Cai
任务设定 超声扫描机器人的探头操控动作生成
痛点动机 现有 RL 方法依赖精细奖励设计和大量交互数据,泛化性和稳定性差
解决方案 提出 US-VLA :融合超声语义反馈,基于专家轨迹数据训练探头动作生成
18

ReRef-3D: A Benchmark for Spatial Referring Expression-Guided 3D Scene Rearrangement

Mary Lynn Martin, Yifei Zhang, Martha Palmer, Maria Leonor Pacheco
任务设定 评测语言指令引导的 3D 场景物体摆放
痛点动机 指令定义的是可行摆放区域而非单点坐标,评估困难
解决方案 提出 ReRef-3D 基准,插入预测位置后检验关系满足与物理合理性
19

Spatial Temporal Synergy: Balancing Change and Invariance in Text Driven 3D Human Motion Editing

Shaohui Lin, Zhenwu Shi, Jingyu Gong, Jiao Xie, Yu Zhou, Baochang Zhang, Lizhuang Ma, Chia-Wen Lin
任务设定 文本驱动的 3D 人体动作编辑
痛点动机 现有方法难平衡文本改变与运动连贯性,易致失真
解决方案 提出 CIME 框架,解耦时空维度,用 RNIMM 模块保持物理节奏保真
20

A Plug-and-Play 2D Motion Interface for Real-World Motion Language Models

Kaname Yokoyama, Norimichi Ukita
任务设定 3D 动作语言模型接受 2D 动作输入
痛点动机 单目视频难获取准确 3D 动作,限制实际应用
解决方案 提出即插即用 2D 动作接口,无需微调对接现有 MoLM
21

Pre-training Visual Dexterity in Simulation

Sarthak Kamat, Adam Rashid, Satvik Sharma, Aseem Doriwala, Chelsea Finn, Phillip Isola, C. Karen Liu
任务设定 为 56 自由度双臂灵巧手操作策略做预训练
痛点动机 真实遥操作数据昂贵,人手视频跨具身误差大
解决方案 让人在 VR 中操作虚拟物体采集机器人视角数据,训练因果 Transformer 后用少量真实演示微调
22

Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning

Yuxing Long, Lei Kang, Ziyan Yu, Yuzheng Gao, Bin Cheng, Jiyao Zhang, Xiaoqi Li, Haolin Yang, Dongjiang Li, Hui Shen, Hao Dong
任务设定 让机器人根据家电说明书完成长时程操作规划
痛点动机 现有模型缺乏支持家电操作规划的多样化数据集
解决方案 构建 分层电器图谱 自动合成数据,训练端到端 AppliancePlan 模型并实现真实机器人部署
23

FlowDance: Music-Driven Dance Video Generation with Parallel Pose and RGB Streams

Genying Li, Boda Lin, Jiachen Li, Zijian Jia, Haojie Zheng, Yiming Wang, Shuchen Weng, Si Li
任务设定 根据音乐生成对应的舞蹈视频
痛点动机 需同时保证动作与音乐对应、身份一致和时序连贯
解决方案 采用并行 姿态 与 RGB 双流,结合时间步感知的姿态注入与身份保持机制
24

Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation

Yijie Xu, Haopeng Jin, Run Zhou, Shengbang Liu, Sixiang Chen, Hongyang Cheng, Sicheng Hu, Peterson Co, Jinwen Luo, Huajie Tan, Shanghang Zhang
任务设定 机器人操作的 VLA 策略学习设计过程奖励模型
痛点动机 稀疏成功信号难探索, OOD 状态下奖励区分度弱
解决方案 提出历史条件成对奖励,结合带符号进度空间与课程学习区分进展、失败与恢复
25

WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations

Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge
任务设定 构建带丰富标注的世界探索合成视频数据引擎
痛点动机 真实采集难同时提供密集几何、长程对应等多种标注
解决方案 虚幻引擎离线渲染场景,同步生成深度、轨迹、光流与点跟踪等标注
26

Gaussian-JEPA: Joint-Embedding Predictive Learning for 3D Gaussian Splats

Bin Ren, Qi Ma, Yue Li, Zongyan Han, Yidi Li, Yuqian Fu, Rao Muhammad Anwer, Theo Gevers, Fahad Shahbaz Khan, Salman Khan
任务设定 面向 3D 高斯泼溅的自监督表征学习
痛点动机 现有重建式方法绑定单一采样实现,泛化性受限
解决方案 借鉴 JEPA 框架,在潜在空间预测被遮挡高斯块特征而非重建属性
27

Algorithm-Architecture Co-Design for Efficient VLA Inference via Speculative Inference and Verification

Chunyu Qi, Zhuoran Song, Jian Weng, Haozhe Jiang, Xueyuan Liu, Naifeng Jing, Guanghui He, Xiaoyao Liang, Haibing Guan
任务设定 加速 VLA 模型在机器人上的实时推理
痛点动机 VLA 计算量大、预测动作短,难以实时部署
解决方案 利用主动/非主动状态特性,推测预测配合轻量验证模型 sVLA 做算法-硬件协同加速
28

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

Matteo Stoiber, Niels Buus Lassen
任务设定 端侧预测第一视角注视点以裁剪视频降低 token 开销
痛点动机 现有方法依赖专用眼动仪,消费级智能眼镜无此硬件
解决方案 提出轻量双过程注视预测器,纯软件实时运行,效果媲美真实眼动数据
29

AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models

Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao, Yu-Chee Tseng, Jen-Jee Chen
任务设定 消除 VLM 对自我/他我中心参照系的空间歧义理解
痛点动机 语言描述常省略参照系,易致具身机器人执行出错
解决方案 构建 AlloEgo-View 数据集微调 VLM ,并在 Isaac Sim 机器人平台验证
30

RigidBench: Evaluating Rigid-Body Physics in Video Generation Models

Swarnim Jain, Shangzhe Wu
任务设定 评测视频生成模型的刚体物理准确性
痛点动机 现有指标混合多种误差,难以分辨物体运动是否正确
解决方案 构建仿真对齐的 RigidBench 基准,分维度评测运动轨迹等指标
31

EcoVLA: Energy-Efficient Device-Edge Co-Inference for Vision-Language-Action Models under Real-Time Constraints

Ao Zhou, Bo Dai, Le Yu, Xingyu Liu, Zeyu Hao, Lingkun Long, Chunming Hu, Jianlei Yang
任务设定 面向 VLA 模型的端边协同推理部署
痛点动机 端侧算力能耗有限,边缘卸载又受网络波动影响,难兼顾实时与节能
解决方案 提出 EcoVLA 框架,联合建模时延与能耗,动态选择最优协同推理方案
32

Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability

Yudong Gao, Linghan Chen, Wenhan Wu, Mia Zhou, Jiyao Wang, Kaiyan Ji, Mingyu Guo, Honglong Chen
任务设定 研究对 VLA 模型的位翻转攻击安全性
痛点动机 量化 INT8 部署下少量比特翻转即可致机器人操作完全失效的风险
解决方案 定位动作生成层关键比特,比较不同动作头架构的攻击脆弱性并提出防护方案
33

PhaseLoRA: Control-Regime-Conditioned Low-Rank Adaptation for Continuous-Action Vision-Language-Action Policies

Yufei Guo, Yinan Wu, Haoran Duan, Guiguang Ding, Jungong Han
任务设定 为连续动作 VLA 策略做分阶段自适应微调
痛点动机 静态 LoRA 更新忽略操作任务各阶段的差异
解决方案 提出 PhaseLoRA ,依据控制阶段描述符动态调制 LoRA 更新方向
34

Low-Rank Dynamics-Effective Latent Carriers for Counterfactual Rollout in Learned World Models

Yang Liu, Yuming Chen
任务设定 探究世界模型隐藏状态与反事实未来的关系
痛点动机 世界模型能预测未来,但不清楚哪些状态在起作用
解决方案 构造低秩隐状态载体,一次编辑就让模型自主展开到指定反事实轨迹
35

HOIMask: Towards Generative Masked Modeling for Human Object Interaction Generation

Yihong Ji, Jinsong Zhang, He Hu, Hongbo Xu
任务设定 生成人与物体交互( HOI )的动作序列
痛点动机 扩散式方法迭代去噪易产生伪影和不稳定交互
解决方案 提出离散掩码生成模型 HOIMask ,用 VQ 编码人物-物体 token 图,结合接触感知引导优化生成
36

CETalk: Continuous Valence-Arousal Control for Audio-Driven 3D Talking Head Generation

Peng Jia, Li Dai, Zhen Xiao, Xueliang Liu, Jia Li
任务设定 音频驱动 3D 说话人头生成,实现情感连续控制
痛点动机 离散情绪类别难以刻画连续情感变化,且音画频率错配
解决方案 提出 CETalk ,用连续效价-唤醒度驱动 FLAME 参数,多尺度时序解耦唇动与情绪
37

Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning

Zihang Wang, Yishan Wang
任务设定 人机协同在线机器人强化学习
痛点动机 需快速吸收人工干预,同时持续超越人类先验策略
解决方案 提出 MC Q-chunk 评论家max-Q 选择性模仿,按状态选高 Q 动作模仿更新
38

EgoTac: In-the-wild Tactile Prediction from Egocentric Vision

Wenkang Zhang, Chengbo Yuan, Zicheng Zhang, Zhengxue Cheng, Yang Gao
任务设定 第一视角视频预测手部触觉信号
痛点动机 触觉数据难采集,而第一视角视频丰富易得
解决方案 构建 570 万图像-触觉对数据集训练通用模型,实现零样本触觉预测
39

SCOPE: Score-Isolated Agentic Optimization for Video World Models

Yuhua Jiang, Jiaming Wang, Qingbin Liu, Feifei Gao
任务设定 对冻结的视频世界模型做推理时自适应优化
痛点动机 推理阶段多组件联动易导致评估归因不清
解决方案 以可审计的类型化状态做有界更新,冻结策略后再评估
40

ForceU-VLA: A Force-Aware Vision-Language-Action Model for Embodied Ultrasound Scanning

Xingzheng Wu, Cheng Zhang, Guihao Yan, Xifeng Hu, Zhi Liu, Qing Cai
任务设定 面向自主具身超声扫描的探头运动控制
痛点动机 力觉与超声图像弱耦合,缺乏扫描阶段感知
解决方案 提出力-超声融合模块,结合阶段自适应调制机制
41

GaussMemory: Task-Driven 3D Gaussian Scene Memory for Long-Horizon Robotic Manipulation

Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa
任务设定 长时程机器人操作中的 3D 场景记忆构建
痛点动机 现有 3D 记忆被动记录,未区分任务相关性
解决方案 3D 高斯泼溅 为几何记忆载体,端到端学习记忆更新策略
42

Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition

Chengyan Wang, Hanliang Xie, Yueyi Yang, Haoyu Chen
任务设定 零样本微手势识别,用多模态大模型判断细微手势
痛点动机 MLLM 对短促、局部的微手势运动线索不敏感易忽略
解决方案 树搜索逐步定位细粒度视觉证据,配合测试时校准修正分数偏差
43

Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models

Yanyan Zhang, Disheng Liu, Kai Ye, Chaoda Song, Xinpeng Li, Mohsen Hariri, Vikash Singh, Yu Yin, Vipin Chaudhary
任务设定 VLA 机器人操作在线中断后的故障恢复
痛点动机 现有恢复方法需失败数据或策略重训练,存在执行风险
解决方案 推理时通过反事实想象延续目标轨迹,再最小化调整机器人与场景以重新对齐,无需微调
44

SpotlessGS: Relightable 3D Gaussian Splatting under Dynamic Illumination for Robotic Perception

Liang Hong, Jiaxin Wei, Simon Schaefer, Stefan Leutenegger, Jaehyung Jung
任务设定 机器人在光照不均暗环境下的可重光照 3D 重建
痛点动机 2D 图像增强缺乏可靠监督,破坏多视角几何一致性
解决方案 扩展 3D Gaussian Splatting ,联合优化光照参数,结合球谐光照模型与 BRDF 反射建模