Daily Paper Feed

2026 年 08 月 21 日 星期五 · 共 26 篇相关论文 · 全部存档
1

4DAnyone: Create Anyone in 4D from a Casual Monocular Video

Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu
任务设定 从随手拍摄的单目视频重建可动画 4D 人体
痛点动机 视频扩散模型多视角生成时一致性差,难扩展到 4DGS 所需视角数
解决方案 提出参考上下文打包目标上下文路由,解决注意力上下文瓶颈,生成一致多视角视频后提升为 4D 高斯
2

Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis

Liang Xu, Chengqun Yang, Zili Lin, Xintao Lv, Yichao Yan, Xin Jin, Zhibo Chen, Xiaokang Yang, Wenjun Zeng
任务设定 构建多模态人-人交互感知与生成基准
痛点动机 现有数据集运动精度低、缺手部动作和丰富多模态标注
解决方案 提出 Inter-X++数据集,含 11388 段全身+手指动作及多模态标注,统一生成与感知任务评测
3

DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao, Kaitong Cai, Chengkai Jin, Chunxiao Liu, Jianbo Liu, Siyuan Huang, Xingang Pan, Hongsheng Li
任务设定 第一人称视频中鲁棒恢复 3D 手部运动轨迹
痛点动机 物体遮挡和手部脱离视野时,现有回归器与扩散模型失效
解决方案 视频扩散模型改造为确定性几何编码器,单次前向提取遮挡区域特征,配合双向时空解码器恢复轨迹
4

Towards Surgical World-Action Modeling: A Preliminary Joint Visual-Trajectory Forecasting for Surgical Motion Planning

Weiliang Huang, Huanrong Liu, Bob Zhang, Qi Dou, Zhen Chen, Yun Gu, Guy Rosman, Qingbiao Li
任务设定 联合预测手术场景视觉演变与器械运动轨迹
痛点动机 现有方法将场景生成与轨迹预测割裂,两者一致性无法保证
解决方案 提出视觉-轨迹联合世界动作模型,分块自回归预测未来视觉状态与器械轨迹
5

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

Shaoxuan Wang, Guangting Zheng, Rui Huang, Zhipeng Tang, Sha Zhang, Jiajun Deng, Yanyong Zhang
任务设定 机器人操作的离线强化学习策略训练框架
痛点动机 扩散/流匹配策略似然难解,自回归流虽精确但采样慢
解决方案 无采样优势加权似然训练,并蒸馏为单步生成器加速部署
6

G3Ego: Gaze-Guided Graphs for Egocentric Action Understanding

Marko Haralović, Akash Ramakrishnan, Estefania Talavera Martinez
任务设定 基于凝视引导的场景图理解第一人称动作
痛点动机 第一人称动作仅依赖少量手物交互,大规模视频预训练效率低
解决方案 构建动作场景图,用佩戴者凝视剪枝无关实体,提升效率与可解释性
7

DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation

Siyuan Ma, Boshi Zhang, Yutian Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Qiaojun Yu
任务设定 腿式移动机械臂的全身世界-动作模型联合预测
痛点动机 现有模型未区分相机自运动与底盘/手臂动作
解决方案 冻结 FastWAM 骨干,训练解耦基座/手臂的残差适配器联合预测视频与动作
8

HandMvNet: Real-Time 3D Hand Pose Estimation Using Multi-View Cross-Attention Fusion

Muhammad Asad Ali, Nadia Robertini, Didier Stricker
任务设定 多视角实时 3D 手部姿态与形状估计
痛点动机 单目方法存在尺度-深度歧义问题
解决方案 多视角交叉注意力融合特征,无需相机参数即可推断 3D 几何
9

Towards Professional Tennis Styles for Humanoid Robots with Adaptive Motion Planning and Tracking

Tao Huang, Ruofei Liu, Xuchen Tang, Xinyin Zhang, Junli Ren, Huayi Wang, Feiyu Jia, Yukai Qi, Kangning Yin, Weishuai Zeng, Lipeng Chen, Xi Li, Ting Wu, Kailin Li, Ruoli Dai, Jingbo Wang, Lei Han, Jiangmiao Pang
任务设定 人形机器人学习专业网球发球与对打风格
痛点动机 兼顾动作风格与任务性能存在 sim-to-real 差距
解决方案 分层规划-跟踪框架,通过速度自适应机制弥合仿真到真实的差距
10

Evidence-Gated Task and Motion Planning with Vision-Language Models

Tsunehiko Tanaka, Matthew Stephenson, Alistair Macvicar, Edgar Simo-Serra
任务设定 长时程操作任务中的证据获取与可行性判断
痛点动机 部分可观测下 VLM 可能生成缺乏观测支持的子目标
解决方案 VLM 探索性子目标获取视觉证据,结合可行性门控决定是否继续规划
11

STEP: Score-Based Temporal Energy for Human Pose Video Anomaly Detection

Jakub Micorek, Mateusz Koziński, Horst Possegger
任务设定 基于骨骼序列的人体姿态视频异常检测
痛点动机 直接对关节坐标加噪声会破坏姿态合理性
解决方案 PCA 白化将姿态映射到规范空间学习能量模型,并加入置信度加权
12

PVRA: A Pointwise Key-point Voting Framework for Robotic Assembly

Kulunu Samarawickrama, Roel Pieters
任务设定 面向渐进式装配任务的机器人自主装配操作
痛点动机 现有方法仅感知物体,缺少对装配依赖关系的建模
解决方案 提出基于 3D 关键点投票的模块化框架,从 RGB-D 输入推理可执行装配动作
13

AvatarDynamizer: From Static to Dynamic Human Avatars via Generative Dynamic Textures

Guoxing Sun, Heming Zhu, Linjie Lyu, Pascal Fua, Christian Theobalt, Marc Habermann
任务设定 静态 3D 虚拟人转化为可驱动的 4D 动态虚拟人
痛点动机 骨骼驱动动画缺乏衣物褶皱等真实表面动态效果
解决方案 纹理空间动态嵌入结合视频扩散模型生成动态纹理,解码为 3D 高斯渲染
14

EXIMO: VLM Guided Exploration of VLA Policies

Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch, Markus Wulfmeier, Abbas Abdolmaleki, Martin Riedmiller
任务设定 高效微调 VLA 机器人策略以学习新任务
痛点动机 遥操作数据采集昂贵,纯 RL 长时序任务样本效率低
解决方案 VLM 做规划器拆解任务并采集数据,再结合模仿学习与残差 RL 微调策略
15

Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents

Fujiang Yuan, Xia Huang, Lusheng Wang, Jun Ding, Zhen Tian, Yuxin Wang, Shaojie Gu, Yuki Funabora, Yanhong Peng, Zebing Mao
任务设定 综述融合大语言模型、知识库与推理能力的具身智能路径
痛点动机 现有具身系统缺乏感知、推理、行动的统一整合框架
解决方案 提出大模型+知识库+推理协同框架,梳理迈向通用具身智能的五大挑战
16

CoToGrasp: Contact-Topology-Conditioned Dexterous Grasp Synthesis via Canonical Workspace Learning

Julien Merand, Boris Meden, Liming Chen, Mathieu Grossard
任务设定 提出基于接触拓扑条件的灵巧手抓取生成方法
痛点动机 现有抓取规划仅追求稳定抓取,难以支持功能任务
解决方案 规范化工作空间解耦物体几何与抓取语义,实现零样本泛化
17

GOAG: Generative and Object-Agnostic Grasp Planner for Dexterous Robotic Manipulation

Julien Merand, Boris Meden, Mathieu Grossard, Liming Chen
任务设定 提出物体无关的灵巧手抓取生成框架
痛点动机 现有抓取模型依赖特定物体数据,难以泛化到新物体
解决方案 学习夹爪接触面的紧凑隐空间分布,推理时引入物体特征实现零样本抓取
18

Gallileo-4D: Frozen Backbone Ensemble for Dynamic 4D Reconstruction

Nicolò Savioli
任务设定 探索冻结骨干网络集成实现动态 4D 重建
痛点动机 微调预训练 4D 骨干网络反而损害挑战集上的泛化性能
解决方案 冻结骨干网络,推理时融合多种解码配置集成以提升重建精度
19

SafeBranch: Branch-Pair Safety Alignment for Embodied Agents

Hyunse Lee, Jiwoo Jeong, Haneul Lee, Kyochul Jang, Youngjae Yu, Woojin Lee
任务设定 训练具身智能体执行指令时避免违反安全约束
痛点动机 安全信号仅出现在少数关键步骤,普通模仿学习难以对齐
解决方案 对不安全轨迹回滚到关键步骤,构造分支对让智能体学会安全替代动作
20

Learning Hierarchical Skill Policies with Offline Quality-Diversity Reinforcement Learning

Tanachai Anakewat, Takayuki Osa, Tatsuya Harada
任务设定 基于离线数据学习分层技能策略用于机器人操作
痛点动机 传统技能提取质量依赖数据集,难以得到多样且高价值技能
解决方案 提出 QDOS ,用优势加权的质量-多样性目标预训练技能并复用离线数据
21

What Matters for Latent Actions in Robot Learning

Xizhou Bu, Qingda Hu, Lei Zhou, Lingfeng Zhang, Yingbo Tang, Zihao Liu, Xinyi Tao, Zhiqiang Ma, Qingqiu Huang, Chufeng Tang, Hongbo Wang, Jing Zhang, Jiayi Ma, Hangjun Ye, Wei Li, Xiaoshuai Hao
任务设定 系统评测机器人操作学习中 潜在动作模型 的设计选择
痛点动机 现有 LAM 方法评测标准不一,难以确定关键影响因素
解决方案 统一对比 41 种设计维度,发现用潜在动作微调 VLM 骨干 效果最佳
22

OrthoSkillVLA: Continual Skill Learning via Gradient-Informed Skill Subspace Adaptation

Jiaqi Wang, Zhou Fang, Qiongfeng Shi, Yi Zhou
任务设定 VLA 模型 持续学习新技能而不遗忘旧技能
痛点动机 顺序微调 VLA 会扰动原有表征,导致灾难性遗忘
解决方案 对 VLM 和动作头分别施加正交子空间约束,并用轻量 MoE 解码器保护速度输出
23

Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models

Yuanhao Ban, Jiaqi Feng, Hengguang Zhou, Xiaohuan Pei, Justin Cui, Cho-Jui Hsieh
任务设定 提升流式自回归视频生成模型的长时 4D 一致性
痛点动机 长视频生成会累积几何漂移,静态奖励会把真实运动误判为误差导致画面僵住
解决方案 前馈式 4D 重建奖励替代静态奖励,并加入运动先验来保持自然运动
24

Fine-Tuning VLAs with Self-Demonstrated Generative Control for Multi-Task Manipulation

Prachi Garg, Steve Xing, Prahit Yaugand, Saurabh Gupta, Derek Hoiem
任务设定 微调 VLA 模型以适配新机器人的多任务操作
痛点动机 微调新机器人专家数据会丢失原有指令跟随与泛化能力
解决方案 用零样本 VLA 自生成在线交互数据辅助微调,兼顾新技能学习与旧能力保留
25

VideoRun2D Demo: Markerless Body Tracking for Biomechanical Analysis of Running

Luis F. Gomez, Julian Fierrez, Roberto Daza, Ruben Tolosana, Aythami Morales, Gonzalo Garrido, Javier Rueda, Enrique Navarro
任务设定 基于视频的无标记人体姿态估计用于短跑生物力学分析
痛点动机 传统标记式动作捕捉成本高,需验证姿态估计器精度是否可替代
解决方案 对比多种人体姿态估计器提取髋膝关节角度,并用后处理模块去除异常值
26

SCAPE: Scenario-Conditioned Simulation-Augmented Policy Evaluation

Dijie Zhu, Seunghun Oh, Ruopeng Huang, Zhiyu Huang, Jiaqi Ma, Chen Tang
任务设定 评估机器人策略在不同场景下的真实世界表现
痛点动机 真实测试成本高难扩展,纯仿真评估存在 sim-to-real 差距
解决方案 用少量真实-仿真配对数据校正仿真偏差,结合保形预测给出场景级置信区间