Daily Paper Feed

2026 年 08 月 20 日 星期四 · 共 18 篇相关论文 · 全部存档
1

ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa
任务设定 大规模 RL 预训练+后训练实现高自由度灵巧手仿真到真实迁移
痛点动机 多指机器人长时程任务难以从零学习,重复训练效率低
解决方案 先在通用重摆姿任务预训练灵巧策略作为先验,再用行为克隆蒸馏、critic 预热和保守更新稳定后训练迁移
2

DA-WAM: Decision-Aligned Future Latents for Driving World Models

Ruiguo Zhong, Benshan Ma, Xiaolong Chen, Lang Zhang, Mingyue Feng, Yaonong Wang, Pei Liu, Jun Ma
任务设定 统一自动驾驶中未来场景预测与轨迹决策打分
痛点动机 现有世界模型预测与规划解耦,未体现动作专属后果
解决方案 为每条候选轨迹生成独立的动作条件未来隐状态,再用打分器评估并监督训练
3

GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gaussian Splatting

Yechan Park, HyunJin Kim
任务设定 让冻结的 VLA 机器人策略适应部署相机视角偏移
痛点动机 相机位置微小偏移就使成功率从 90% 降到 10%,重训练代价高
解决方案 3D 高斯溅射做新视角合成,插在策略前做视角规范化,无需改动策略权重
4

LT-Mem: Volatility-Aware Spatio-Temporal Memory for Lifelong Scene Understanding

Yumin Lee, Hyoseok Ju, Giseop Kim
任务设定 机器人在长期多次重访场景中持续追踪物体历史状态
痛点动机 现有系统易出现'时间失忆',无法回答物体跨会话变化的查询
解决方案 提出易变性感知的时空记忆框架,用三层记忆结构支持长期物体级推理
5

Generalized Audio-Driven Synthesis of Precise Drummer Motion

Álvaro G. Iñesta, Mattia Ryffel, Amit H. Bermano, Robert W. Sumner, Martin Guay
任务设定 从音频生成精确的鼓手打击动作
痛点动机 打击动作需要高加速度与厘米级精度,现有方法难以泛化到真实音频
解决方案 扩散模型结合双目标损失,解耦骨骼自然性与鼓槌打击精度
6

Beyond Placement and Articulation: Usage-Driven Code Scenes for Embodied Interaction

Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie, Ran Yi
任务设定 为具身智能生成可执行的 3D 场景代码
痛点动机 现有场景生成仅关注摆放和关节,缺少功能可用性建模
解决方案 提出 RoomWright ,以任务为中心做物体功能推理,并用代码规则表达多物体交互逻辑
7

MLREF: Efficient Module Reuse for Reward Design in Reinforcement Learning via Large Language Models

Chenglin Liu, Xun Wang, Ruishuo Chen, Zhuoran Li, Longbo Huang
任务设定 LLM 自动设计强化学习的奖励函数
痛点动机 现有方法把奖励当整体程序生成,难以复用已验证的有效模块
解决方案 提出模块化奖励池,通过反思优化、混合信用分配和合并回滚机制持续演化奖励组件
8

Decision-Metric Alignment in Latent World Models: Diagnostics and Action-Conditioned Objectives for MPC Planning

Jiawei Wang, Ke Rui, Yushen Zuo, Yichun Feng, Minglei Li
任务设定 评估潜在世界模型用于 MPC 规划时的决策对齐问题
痛点动机 潜在距离排序未必符合真实任务进度
解决方案 提出 Plan-Real Spearman 等排序一致性指标,并用逆动力学目标改进 LeWM 模型
9

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo
任务设定 面向动态场景的 4D 视觉-语言联合表征学习
痛点动机 现有编码器缺乏同时建模空间结构运动演化的能力
解决方案 提出 CL4D 对比学习对齐 4D 动态点云与文本,构建 4DVLM 实现零样本运动-文本检索
10

EgoHRV: Continuous Heart Rate Variability Estimation from Egocentric Systems for Autonomic Response and Skill Assessment

Berken Utku Demirel, Christian Holz
任务设定 第一视角头显摄像头估计心率变异性( HRV )
痛点动机 运动和噪声掩盖了注视视频中的细微心跳信号
解决方案 3D 主干网络 + 高低频分解模块提取血容量脉搏信号,跨域预训练对齐信号频域表示
11

CamWorldQA: Perceptual Quality Assessment of Camera-Controlled World Video Generation

Yunhe Li, Likun Wu, Sijing Wu, Xinyu Tian, Huiyu Duan, Yixuan Gao, Yunhao Li, Guangtao Zhai
任务设定 面向相机可控世界视频生成的感知质量评估基准
痛点动机 现有视频质量评估方法无法捕捉视角一致性等生成特性
解决方案 构建 CamWorldQA 基准,并提出多分支网络 CWQA 融合空间、时序与光流特征预测质量分数
12

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

Mohammad Zamani, Fatemeh Ziaeetabar
任务设定 综述面向第一人称视频理解的视觉语言模型研究
痛点动机 自运动、遮挡、小物体等使自我中心视觉理解困难
解决方案 系统梳理 VLM 在任务、数据集、手物交互及具身智能中的应用与局限
13

DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer

Yansong Wang, Zhaobo Qi, Xinyan Liu, Beichen Zhang, Shuhui Wang, Weigang Zhang, Qingming Huang
任务设定 具身交互场景中物体动力学建模与运动轨迹预测
痛点动机 现有方法压缩为稀疏关键点,丢失细节导致轨迹漂移
解决方案 基于 3D 高斯粒子图,结合时序解耦网络与图 Transformer 建模多尺度时空交互
14

Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models

Pardis Taghavi, Reza Langari, Gaurav Pandey
任务设定 视频生成与世界模型中的免训练稀疏注意力加速
痛点动机 现有稀疏注意力方法未指定可执行算子,误差难以控制
解决方案 提出 SparsePR :响应耦合分区+探针拟合残差重建,降误差并提速 1.5-2.6 倍
15

Depth Anything V4: Dynamic 4D Scene Reconstruction via Riemannian Flow Matching on 4D Gaussian Splatting

Jiaming Fan, Jian Lu, Jinling Jia, Chenbin Zhang
任务设定 从单目视频重建动态 4D 场景
痛点动机 如何保证 4D 高斯参数在非欧流形上的中间状态合法
解决方案 提出黎曼流匹配,直接在 4D 高斯的尺度、旋转等流形上建模概率路径
16

GuideFetch: A Task Coordination Framework for Concurrent Navigation and Object Retrieval in Assistive Robot Dogs

Qian Yin, Ruiping Liu, Kunyu Peng, Jianxiang Man, Isik Baran Sandan, Junwei Zheng, Yufan Chen, Di Wen, Kailun Yang, Rainer Stiefelhagen
任务设定 协调导盲犬与取物机器狗并行完成导航取物任务
痛点动机 LLM 生成计划可能违反机身约束,动作看似成功也未必真完成
解决方案 LLM 生成日程化四动作方案,执行前校验目标可行性,实现并行调度降低耗时
17

GigaBrain-WBC-0.5: A Behavior World Model for Robust Whole-Body Control with Environment Interaction

Ziyang Cheng, Tianshu Tang, Jinxin Lan, Xinze Chen, Yuhan Gong, Zhichao Liu, Changzhong Wu, Yahao Mao, Zongyan Deng, Mingxuan Ma, Huasen Xi, Yilong Liu, Yutong Wu, Xiaofeng Wang, Yang Wang, Yun Ye, Guan Huang, Xiaojie Jin, Zheng Zhu, Jiwen Lu
任务设定 人形机器人全身控制需应对地形与物体接触
痛点动机 现有策略仅在空场景训练,无法建模环境交互
解决方案 提出行为世界模型,用因果 Transformer 联合预测动作、状态与行为分布,在线纠正不可行指令
18

Human-Centric Intelligence in the Era of Foundation Models: A Survey

Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo
任务设定 基础模型时代以人为中心的智能研究综述
痛点动机 相关研究在任务、模态和社区间割裂,缺乏统一框架
解决方案 提出涵盖外观、动力学与具身智能体的六层级人类语境分类体系,系统梳理方法与数据集