Daily Paper Feed

2026 年 09 月 17 日 星期四 · 共 34 篇相关论文 · 全部存档
1

PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics

Bardienus P. Duisterhof, Kaifeng Zhang, Adam Hung, Bowen Wen, Stan Birchfield, Yunzhu Li, Deva Ramanan, Jeffrey Ichnowski
任务设定 从 RGB-D 图像预测 3D 点轨迹以学习场景动态
痛点动机 现有方法依赖机器人动作标签,无法利用网络视频数据
解决方案 提出 3D 点轨迹补全预训练任务,用 Transformer 学习可迁移动态先验,用于操作与模仿学习
2

In-Context Robot Learning with VLM Agents

Dongzhou Cheng, Taoran Yi, Ye Fang, Xingwu Zhang, Fan Feng, Yixuan Li, Gengxiong Zhuang, Rongze Wang, Shuai Yang, Wei Song, Weizhi Xue, Minyan Wu, Jie Gui, Jiaqi Wang, Tong Wu
任务设定 让机器人像人一样从上下文中即时学习新任务
痛点动机 有限演示无法覆盖所有任务,现有策略难以上下文学习
解决方案 提出 GPT-Policy 框架,用 VLM 从演示和交互反馈提出并验证动作,无需梯度更新
3

Dreaming the Sound of Contact: Leveraging Video and Audio Generation for Zero-Shot Force-Aware Manipulation and Data Generation

Guanhua Ji, Tianyu Li, Dayoon Suh, Yuqian Zhang, Boyan Zhang, Nadia Figueroa
任务设定 从生成视频学习接触力感知的机器人操作轨迹
痛点动机 纯运动学生成视频缺乏力信息,接触密集任务易失败
解决方案 结合视频与音频生成,用接触声音响度推导期望力曲线,闭环力控制执行
4

Track, Articulate, Act: Generating Articulation from Casual Human Videos

Jiaming Zhang, Homanga Bharadhwaj
任务设定 单目人类视频重建可仿真的关节物体与手部交互
痛点动机 关节物体运动依赖部件和关节,难以用单一位姿表示
解决方案 稠密 3D 点轨迹分割固定与运动部件,推断关节类型和状态并重建资产
5

rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference

Kaijun Zhou, Zhiyang Li, Le Chen, Jinyu Gu
任务设定 加速 VLA 模型在具身机器人上的推理
痛点动机 VLA 推理延迟影响机器人响应,现有框架未利用任务相似性
解决方案 仿照肌肉记忆设计双阶段缓存,复用视觉 token 与神经元激活模式加速推理
6

PhysVGGT: Feed-Forward Dense Physical Property Estimation from A Single Image

Sneha Paul, Guile Wu, Bingbing Liu, Dongfeng Bai
任务设定 从单张 RGB 图像前馈预测物体密集物理属性
痛点动机 现有方法需逐物体重建或调用 VLM ,开销大
解决方案 视觉几何 Transformer 提取几何特征,密集预测摩擦力、硬度等物理量及物体质量
7

NormLift: From Lifted Features To Semantic Reliability In 3D Gaussian Splatting

Yihan Zang, Da Li, Dominik Engel, Shinkyu Park, Ivan Viola
任务设定 将 2D 语义特征提升到 3D 高斯做开放词汇场景理解
痛点动机 现有方法按渲染视角理解特征聚合,与下游余弦查询方式不匹配
解决方案 把逐高斯特征分配建模为 CLIP 球面余弦对齐,用特征模长作可靠性信号指导投票细化
8

Video-Based Markerless Motion Capture for Clinical and Rehabilitation Biomechanics: A PRISMA-ScR Scoping Review of Validated Architectures, Clinical Readiness, and Emerging Methods

Florian Delaplace, Elodie Piche, Frédéric Chorin, Raphael Zory
任务设定 综述视频无标记动作捕捉在康复生物力学中的应用
痛点动机 光学动捕成本高、场地受限,临床可用精度尚不明确
解决方案 系统综述 117 项研究,比较无标记动作捕捉架构与关节角度精度
9

GenStream: Semantic Streaming Framework for Generative Reconstruction of Human-centric Media

Emanuele Artioli, Daniele Lorenzi, Shivi Vats, Farzad Tashtarian, Christian Timmerer
任务设定 人体中心视频流的语义化压缩与重建
痛点动机 传统编解码逐像素传输,带宽浪费严重
解决方案 骨骼关键点+相机参数+3D 背景替代像素,端侧生成式重建人体,带宽降 99.9%
10

VibeAvatar: Aligning Phonetic Kinematics and Human Aesthetics for High-Fidelity Talking Avatar Synthesis

Qilin Wang, Mingyu Li, Hao Tang
任务设定 从肖像图像和语音生成说话人视频
痛点动机 唇形准确、动作美感与推理效率难以兼顾
解决方案 语音动力学适配器解耦唇形,用 GRPO 强化学习优化动作美感策略
11

HAP: A Hand-Driven Active Perception Framework for Egocentric Head Motion Prediction

Yunji Feng, Junyi Ma, Guanzhong Sun, Chenyang Xu, Hesheng Wang
任务设定 第一视角下预测未来头部 6DoF 运动
痛点动机 头部运动预测研究不足,需结合手部意图与遮挡关系
解决方案 利用手部运动推断目标置信度,构建遮挡关系图融合头手历史预测轨迹
12

DiT-Garment: Garment Dynamics with Diffusion Transformers

Antoine Dumoulin, Laurence Boissieux, Joao Regateiro, Pierre Hellier, Stefanie Wuhrer
任务设定 对人体运动生成动态 3D 服装形变
痛点动机 现有方法难以泛化到未见服装设计与材质
解决方案 基于扩散 TransformerUV 空间学习服装形变分布,结合姿态与物理参数条件
13

ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models

Shijie Lian, Bin Yu, Zhaolong Shen, Xiaopeng Lin, Yichao Du, Zhirui Zhang, Laurence T. Yang, Kai Chen
任务设定 为自回归 VLA 模型设计更优的动作分词方法
痛点动机 现有分词只看重构误差,忽略动作间相对关系保真度
解决方案 提出 ActionPiece ,联合优化表征与量化以保留动作间相对物理关系
14

CSWAM: Better Causal Semantic Representations for Out-of-Distribution Generalization in World Action Models

Tianbin Liu, Jian Zhu, Taiyi Su, Jianjun Zhang, Chong Ma, Zitai Huang, Yi Xu
任务设定 提升世界动作模型在视觉分布偏移下的泛化能力
痛点动机 FastWAM 依赖外观细节重建,遇新场景泛化差
解决方案 引入基于 V-JEPA 的因果语义专家,用历史观测的因果注意力增强动作去噪
15

Risk-Aware World Modeling with Flow-Guided Occupancy Evolution for Selective Trajectory Planning in Automated Driving

Rongxiang Zeng, Linsen Cai, Jiafu Zhang, Yijie Zhong, Yide Tao, Shuai Wang, Nan Zheng, Hai L. Vu, Alvaro Garcia Hernandez, Yongqi Dong
任务设定 自动驾驶中风险感知的世界模型轨迹规划
痛点动机 需预判交通风险并决定何时修正已规划轨迹
解决方案 流引导占据演化预测场景,结合风险场校正候选轨迹的碰撞得分
16

WetRobo: A Reproducible Robot Kit for Coding Agents in Biological Laboratories

Yuna Oikawa, Kei Endo, Takanori Uzawa, Yunzhe Zhang, Manan Anjaria, Lerrel Pinto, Sherry Yang, Koji Tsuda
任务设定 面向生物实验室的可复现机器人套件
痛点动机 VLA 策略换实验室环境易失效,难以迁移
解决方案 提供机械臂、演示数据和技能文件,让编码智能体现场编写程序完成任务
17

StrucPhysVideo: Learning Physical Dynamics from Structured Captions and Robot Actions

Awomo-WM Team: Enhui Ma, Kaiwen Guo, Tingrui Zhang, Wei Song, Yingshui Tan, Jianhua Xu, Tong Zhang, Kaicheng Yu
任务设定 构建面向具身智能的物理动态视频世界模型
痛点动机 现有视频生成缺乏物理事件监督,动态建模不准
解决方案 结构化物理标注数据训练 MoE 视频模型,并扩展为动作条件交互式世界模型
18

Prosthesis-Aware 3D Human Pose Estimation: A Dataset and Benchmark for RSP Users

Yilin Wen, Kechuan Dong, Fumiya Suginaka, Ken Endo, Yusuke Sugano
任务设定 跑步假肢使用者的三维人体姿态估计
痛点动机 现有人体模型无法表达假肢几何,遮挡下不可靠
解决方案 构建 RSP3D 数据集,提出模型驱动+无模型混合基线方法
19

Pose2Muscle: Structured Spatio-Temporal Decoding for Discrete Muscle Activity Estimation from Human Pose

Yuepeng Chen, Jiehong Shi, Kaili Zheng, Boyi Zhang, Chenyi Guo, Ji Wu, Xiangling Fu
任务设定 由人体姿态推断离散的肌肉激活状态
痛点动机 表面肌电传感器不便于长期真实场景监测
解决方案 多尺度时空注意力提特征,图结构解码器推理肌肉状态轨迹
20

Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model

Haoyu Zhao, Zihao Zhao, Tianyu Deng, Ziqin Xu, Zihao Zhang, Xudong Wang, Jinxiang Guo, Chen Gao, Ziyi Ye, Yeying Jin, Jiaxi Gu, Zuxuan Wu, Shuicheng Yan
任务设定 评估全模态生成模型的物理世界推理能力
痛点动机 现有评测输入模态单一,难以考察跨模态世界推理
解决方案 设计音频-图像、前缀视频等互补线索任务,测试模型综合推断潜在事件
21

${M}^2$Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models

Chunpu Xu, Zhixuan Liang, Yuhao Zhang, Chi-Min Chan, Jessie Wang, Yang Xiao, Mengkang Hu, Xiaokang Yang, Yao Mu
任务设定 VLA 模型设计动作分词器
痛点动机 现有分词器重建误差大,限制精细控制
解决方案 多头多码本量化分解动作特征,降低重建损失、提升策略性能
22

Energy-Regularized Imitation Learning for Force- and Work-Aware Robotic Manipulation

Toshiki Otani, Hiromu Taketsugu, Norimichi Ukita
任务设定 研究机器人操作中的能耗感知策略微调
痛点动机 现有模仿学习策略忽略机械能耗,动作不够省力高效
解决方案 训练可微能量预测器估计机械功耗,作为正则项微调预训练操作策略
23

PRISM: Predictive Representation of Interaction Style and Motion for Social Robot Navigation

Bo-Han Chen, Hiromu Taketsugu, Norimichi Ukita
任务设定 拥挤场景下机器人的社交导航策略学习
痛点动机 现有方法仅建模行人几何状态,忽略个体交互风格差异
解决方案 Transformer 从轨迹推断交互风格潜变量,辅助导航策略决策
24

A Comprehensive Review of Generative Physical Artificial Intelligence

Satyam Gaba, Krutiksinh Rana, Siva Sai, Vinay Chamola, Dusit Niyato
任务设定 综述具身智能中生成式物理 AI 系统的架构与应用
痛点动机 各类物理 AI 方法分散,缺乏系统性梳理与关系分析
解决方案 提出五类分类法(机器人基础模型、VLA、大行为模型、扩散策略、世界基础模型),分析其互补关系
25

Not All Layers Need Tuning: Diagnosing and Directing Adaptation in Vision-Language-Action Models

Shahram Najam Syed, Arthur Jakobsson, Prayuj Sachdev, Jeffrey Ichnowski
任务设定 研究 VLA 模型微调时各网络区域的适配成本差异
痛点动机 现有方法对所有区域用统一容量适配器,忽略区域间差异
解决方案 提出诊断-分配-适配流程,按区域重要性自适应分配 LoRA 秩预算
26

Finder: Agentic Closed-Loop Object Finding for Embodied Grounding

Shixiong Xu, Zhiyuan Chen, Song Ding, Rui Luo, Xiaowei Liang, Dongxu Miao, Zhiying Du
任务设定 在部分观测的 3D 场景中按语言指令查找目标物体
痛点动机 在线探索代价高,静态地图查询又不够灵活准确
解决方案 提出闭环智能体 Finder ,通过规划-验证-决策循环动态调整感知与检索
27

Missing Bridges: Composition-Aware Active Imitation Learning

Maxwell J. Jacobson, Ahmed H Qureshi, Yexiang Xue
任务设定 主动模仿学习中如何选择示范请求
痛点动机 组合式多任务场景下示范难复用,标注成本高
解决方案 提出 AALT,构建潜在拓扑结构寻找桥接示范,并用扩散策略逐步规划执行
28

Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control

Mingyang Chen, Shengdong Chen, Xiaoxiao Fu, Bosheng Gong, Haoyuan Guo, Bowen Li, Jiawen Li, Kejun Li, Tianpeng Li, Yin Liu, Haoze Sun, Zeyang Tian, Meng Wang, Xinmiao Wu, Jiangqiao Yan, Zining Zhao
任务设定 构建可交互实时世界模型,支持键盘与文本联合控制
痛点动机 现有世界模型难以兼顾低成本与实时事件级控制
解决方案 提出 5B 自回归世界模型,统一动作与文本条件,结合蒸馏实现 24 FPS 实时生成
29

RoboVAD: A Large Cross-Domain Evaluation Benchmark for Anomaly Detection in Robotic Arm Manipulation Videos

Alexandru-Bogdan Dura, Sebastian Balmus, Radu Tudor Ionescu
任务设定 检测机械臂操作视频中的异常动作
痛点动机 现有基准数据少,难以评估跨领域未见任务/异常类型
解决方案 构建大规模跨域基准 RoboVAD ,测试视频异常检测方法在新任务上的泛化能力
30

Learning Multi-Humanoid Pickup and Transport via Decentralized Object-Centric Control

Bikram Pandit, Mohitvishnu S. Gadde, Aayam Kumar Shrestha, Alan Fern
任务设定 多台人形机器人协作搬运不同尺寸重量物体
痛点动机 任务需求不同的机器人团队规模,难以统一控制接口
解决方案 提出去中心化物体中心控制,各机器人负责局部抓取区,通过双手捏取实现单机/协作/仿真到真实迁移
31

HINT-Plan: Human Intention-Aware Robot Task Planning in Context-Rich Environments using Vision Language Models

Yuchen Liu, Luigi Palmieri, Lujun Li, Radu State, Ilche Georgievski, Marco Aiello
任务设定 在人机共存场景中做人类意图感知的机器人任务规划
痛点动机 现有方法多聚焦避障,忽视高层人类意图与场景语境
解决方案 视觉语言模型预测人类意图并转化为目标状态,结合层次化场景图完成联合任务规划
32

REVERSAL-BENCH: A Reversibility Axis and Reset Oracle for Measuring the Reset-Free RL Cliff

Riyaaz Shaik, Chandru Venkataraman
任务设定 构建 无重置强化学习 操作任务可逆性基准
痛点动机 真实操作不可逆,现有方法忽视状态不可恢复问题
解决方案 用参数 ρ 控制可逆性,配 重置预言机 验证状态可恢复性,揭示可逆性悬崖现象
33

CapMem: A Benchmark for Caption-Based Episodic Memory in Egocentric Video

Dingli Liang, Yiqiao Xie, Yukai Huang, Zhaokai Wang, Weitong Cai, Guangwen Feng, Jifei Song, Zhensong Zhang, Hang Zhang
任务设定 研究 第一视角长视频 的字幕式情景记忆问答任务
痛点动机 长视频下 VLM 帧数受限、检索易失效,需高效记忆方案
解决方案 文字字幕 作可复用情景记忆,结合检索-验证机制提升问答准确率
34

LEAP: Learning Emergent Active Perception for Quadruped Navigation

Ü. Bora Gökbakan, Stéphane Caron, Philippe Souères
任务设定 四足机器人在危险地形中视觉导航寻找目标
痛点动机 手工设计的主动感知代理目标常与任务本身冲突
解决方案 仅用任务压力训练策略,让注视控制行为自然涌现,无需额外奖励