Daily Paper Feed

2026 年 09 月 16 日 星期三 · 共 23 篇相关论文 · 全部存档
1

PhysStream: Streaming Physics-Grounded Video Generation with Structured Scene Memory and Fine-Grained Motion Control

Chuhao Chen, Peter Wonka, Chaoyang Wang, Chen Wang, Qiao Feng, Sergey Tulyakov, Lingjie Liu
任务设定 图到视频生成中实现细粒度物理运动控制
痛点动机 现有方法要么需预设完整控制序列,要么仅操控像素位置
解决方案 自回归模型结合结构化场景记忆和稀疏速度信号,学习真实物理动态
2

SlotDiT: Object-Centric Representations for Diffusion Transformers

Gjergj Plepi, Sven Behnke
任务设定 面向视频生成与机器人任务的物体级隐空间表示
痛点动机 现有 VAE 隐空间缺乏语义结构,影响生成质量和下游效果
解决方案 提出 SlotDiT ,用物体级 slot 隐空间替代 VAE ,自回归预测物体轨迹生成视频
3

Exploring 2D backbone effects for indoor semantic occupancy prediction

Shizhang Fanga, Wanling Yea, Qi Zheng
任务设定 研究 2D 图像编码器对室内语义占用预测的影响
痛点动机 现有 embodied 场景理解流程常忽视图像骨干网络选择
解决方案 固定 3D 融合结构,仅替换 2D backbone (如 DINOv2 ),发现其对精度影响远超架构改进
4

FluxVLA Engine: A One-Stop VLA Engineering Platform for Embodied Intelligence

Yinhao Li, Weixin Mao, Zihan Lan, Jikun Rong, Qirui Hu, Yiming Zhang, Weipeng Deng, Bowen Shen, Minzhao Zhu, Yiming Mao, Yan Yang, Chenguang Cui, Hongyuan Chen, Xu Huang, Zheyi Zhao, Pinxi Shen, Bozhen He, Zhen Fu, Yifan Wang, Zexin Zhang, Ang Gao, Haoyu Chen, Chengqi Shi, Hua Chen
任务设定 VLA/世界动作模型打造一站式具身智能工程平台
痛点动机 算法落地受限于数据、训练、部署接口碎片化
解决方案 统一数据与模型接口,结合实时分块推理与人机协同修正闭环
5

EventEgoHands++: Event-based Egocentric 3D Hand Mesh Reconstruction with Real Dataset

Ryosei Hara, Wataru Ikeda, Masashi Hatano, Mariko Isogawa
任务设定 基于事件相机的第一人称 3D 手部网格重建
痛点动机 佩戴者运动带来密集背景事件,左右手区分困难
解决方案 引入实例级手部检测器与自适应注意力建模双手交互
6

GeoLAM: Learning Geometry-Grounded Latent Actions from Unlabeled Human Videos

Yifan Xie, Hekun Tian, Jinkun Liu, YuAn Wang, Qiao Sun, Wenbo Ding
任务设定 从无标注人类视频中学习几何潜在动作表示
痛点动机 视觉重建易将动作与外观、相机运动混淆
解决方案 4D 几何教师监督潜在动作,再驱动世界-动作模型完成机器人操作
7

sensVLA: Spatially-Grounded Vision-Language-Action Model for Autonomous Wheel Loader

Gopi Krishna Erabati, Bjarne Johannsen, Angus Stewart, Vardeep Singh Sandhu
任务设定 面向自主装载机的视觉-语言-动作控制
痛点动机 需联合推理任务语义、视觉与 3D 场景几何
解决方案 VLM 提供语义上下文,BEV 几何直接接入动作专家做流匹配控制
8

TEMPO: Learning Temporal Context for Dynamic Robot Manipulation

Zhenyang Feng, Jimin Heo, Erik B. Sudderth, Unnat Jain
任务设定 为动态机器人操作任务增强 VLA 模型的时序理解
痛点动机 单帧观测导致运动模糊状态混淆,动态任务易失败
解决方案 引入冻结视频模型提取的运动摘要本体感觉历史,无需改动骨干网络
9

Seeing What Matters: Visual Cue Guided Video Planning for Generalizable Robot Navigation

Hojin Lee, Sizhe Lester Li, Maximilian Hilger, Susie Lu, Achim J. Lilienthal, Vincent Sitzmann, Daniel A. Duecker
任务设定 视频生成模型做机器人长时程导航规划
痛点动机 长时程规划和视频到动作的精确转换仍待解决
解决方案 用 BEV 地图和自车视角作视觉线索引导视频规划,再用逆动力学模型把光流转成动作
10

World Models for Embodied Intelligence: From Plausible to Controllable to Actionable

Nanjie Yao, Hao Wang, Chong Cheng, Zhikang Chen, Wenzhe Li, Jiafei Lyu, Li Shen, Peilin Zhao, Zongqing Lu, Gao Huang, Steven Hoi, Dacheng Tao, Deheng Ye
任务设定 综述具身智能中世界模型的能力层级
痛点动机 现有综述未厘清哪些预测能力真正提升行为决策
解决方案 提出可信/可控/可行动三级框架,用 3x4 矩阵分析几何物理与动作对齐
11

MEgoVista: Multi-view Ego-aware Motion Estimation for Metric 4D Hands and Head in the Wild

Jiangong Xiao, Zhihao Zhang, Yifei Dong, Chao Ma, Zhouyi Jin, Zhiwen Hou, Li Liu, Weihuang Chen, Hongbin Sun, Maoqing Yao
任务设定 从野外头戴相机视频重建度量级双手与头部 4D 运动
痛点动机 现有度量级手部数据依赖工作室装备,难以扩展到真实场景
解决方案 基于双目立体标定获取真实尺度,离线重建统一坐标系下的手部与头部轨迹并经动捕验证
12

Weave: Learning Whole-Body Dexterous Loco-Manipulation from Human-Object Interactions

Liu Cao, Xingze Wu, Jingzhi Cui, Botian Xu, Mingzhi Pei, Ruoqu Chen, Mengdi Xu
任务设定 学习人形机器人全身灵巧的人-物交互操控
痛点动机 人类演示到机器人的接触迁移因体型与动力学差异而困难
解决方案 通过接触感知重定向将人类演示转为机器人动作,用接触与几何感知策略联合控制全身与灵巧手
13

EgoPathBench: Evaluating Zero-Shot Egocentric Waypoint Decision-Making in Vision-Language Models

Yang Zhao, Zhuo Chen, Xubo Yang
任务设定 评测 VLM 在第一视角下的路径点导航决策能力
痛点动机 现有空间智能基准仅测孤立判断,缺乏综合导航评测
解决方案 构建 EgoPathBench 基准,用带标注路径点的第一视角图像评测导航能力
14

ProxiDex: Learning Dynamics-Guided Proximity Policy for Dexterous Manipulation

Yushan Bai, Boyu Zheng, Zhiyang Mao, Hongzheng Sun, Yuchuang Tong, En Li, Zhengtao Zhang
任务设定 灵巧手多指操作中建模手物交互的接近状态
痛点动机 视觉遮挡、触觉标定负担使接触状态难以稳定感知
解决方案 提出 ProxiDex ,用接近点云表征交互,学习动作条件化的接近动力学来指导策略
15

The Neverwhere Visual Parkour Benchmark Suite

Ziyu Chen, Henghui Bao, Haoran Chang, Alan Yu, Ran Choi, Kai McClennen, Gio Huh, Kevin Yang, Ri-Zhao Qiu, Yajvan Ravan, John J. Leonard, Xiaolong Wang, Phillip Isola, Ge Yang, Yue Wang
任务设定 评测视觉运动控制器在真实场景中的表现
痛点动机 真实世界部署测试代价高,仿真与现实存在训练评测差距
解决方案 3D 高斯泼溅重建 60 余个城市室内外场景,搭建逼真闭环仿真基准
16

ConGraspXL: Controllable Constraint-Conditioned Dexterous Grasping Motion Synthesis

Hui Zhang, Mirko Meboldt, Jie Song
任务设定 可控约束条件下的灵巧抓取动作合成
痛点动机 已有方法难以按任务约束(方向/接触/轨迹)精细控制抓取
解决方案 提出分层约束表示与掩码残差接口,动态腕部引导实现精确可控抓取
17

Racing in Volume with Flow Ensembles

Saswat Subhajyoti Mallick, Riu Cherdchusakulchai, Marc Ruiz Olle, Albert Mosella-Montoro, Jose Ribeiro-Gomes, Francisco Vicente Carrasco, Fernando De la Torre
任务设定 稀疏外部相机下快速运动物体的流式 4D 重建
痛点动机 现有流式 4D 重建仅限室内慢速场景,室外高速场景无解决方案
解决方案 融合稀疏匹配、光流与 4D 高斯泼溅,卡尔曼式时序更新提升精度效率
18

SceneBench: A Hierarchical Benchmark for Vision-Language Understanding of 3D Scenes

Anubhav Khanal, Prabigya Acharya, Roshni Poudel, Sujan Kapali, Bigyan Bhatta, Pramish Paudel, Francois Rameau, Danda Pani Paudel
任务设定 面向 3D 场景的视觉语言理解分层基准测试
痛点动机 现有 3D 数据集丢失纹理等视觉细节且缺乏层级化标注与多步推理评测
解决方案 构建 966 个高斯泼溅重建场景,标注层级语义并设计多步空间推理任务
19

World-Action Models for Robot Learning and Control: A Survey

Zuxing Lu, Hongjia Zhai, Guanzhi Wang, Huajian Zeng, Jiaqi Yang, Jingyu Liu, Lei Cheng, Yuantai Zhang, Yuheng Qiu, Zezhou Cheng, Ivan Laptev, Danfei Xu, Benjamin Riviere, Giuseppe Loianno, Eric Xing, Xingxing Zuo
任务设定 综述机器人学习中的世界-动作模型( WAM )
痛点动机 未来预测与动作生成常割裂,缺乏统一梳理
解决方案 提出统一分类法梳理表征、转移建模、动作接口,总结数据集、基准与挑战
20

EMODY Flow: Emotion-Aware Audio-Driven Full-Body Motion Generation

Harsh Kumar Agarwal, Xavier Alameda-Pineda, Olivier Perrotin
任务设定 根据语音和情绪标签生成全身动作与表情
痛点动机 强条件信号被弱化,导致动作对情绪不敏感
解决方案 双路扩散模型 分别生成 SMPL-X 体态和 FLAME 表情,并用情绪分类器强化区分度
21

CTAN: Cycle-Temporal Attention Network for Embodied Audio-Visual Navigation

Teng Liu, Yinfeng Yu
任务设定 机器人依据视觉和双耳音频进行声源导航
痛点动机 现有多模态融合难以捕捉几何语义关系,导致信息退化
解决方案 循环一致性跨注意力 强化视听语义对齐,结合 时序记忆模块 融合历史信息
22

Talking Head Synthesis with Facial Landmark Guidance via 3D Gaussian Splatting

Ziheng Yang, Yinfeng Yu, Yongming Li
任务设定 音频驱动的 3D 说话人头部生成
痛点动机 语音特征缺乏显式面部结构信息,导致嘴部动作不准确
解决方案 面部关键点 引导 3D 高斯 分布增强表情敏感区域,并做全局关键点补偿
23

Transformer-Based Token Fusion and Dynamic Graph Planning for Audio-Visual Navigation

Shaohang Wu, Yinfeng Yu
任务设定 依据声源进行视听导航中的动态路径规划
痛点动机 视觉感知不完整时缺乏自适应重规划能力,导致导航低效不安全
解决方案 Transformer 融合多模态线索,结合 动态图规划 实时避障重规划