Daily Paper Feed

2026 年 07 月 28 日 星期二 · 共 15 篇相关论文 · 全部存档
1

Robot-Factored World Models via Robot Rendering

Byungjun Kim, Taeksoo Kim, Hyunsoo Cha, Hanbyul Joo
任务设定 动作条件视频世界模型预测机器人未来观测
痛点动机 直接用动作指令训练容易导致学习困难或信息泄露
解决方案 将机器人运动学渲染为几何体,构建机器人分解式世界模型
2

SM4RT: Learning Structured Motion Geometry for 4D Reconstruction

Shing Ho J. Lin, Wenzhao Zheng, Dong Zhuo, Yuqi Wu, Jie Zhou, Jiwen Lu
任务设定 单目视频的 4D 场景动态重建与运动感知
痛点动机 现有方法把运动视为孤立点位移,忽略刚体运动的结构
解决方案 提出 Structure-of-Motion 表示运动,用 SE(3) 运动基和稀疏权重描述刚体运动
3

Robot Learning to Communicate through Projected Visual Abstractions

Danyang Yan, Boyuan Wang, Jiaxun Liu, Boyuan Chen
任务设定 让机器人通过投影视觉抽象(如手影)表达意图
痛点动机 机器人通常只能靠身体动作交流,难以传达抽象含义
解决方案 灵巧手和可微自模型学习姿态到影子的映射,梯度优化生成动作
4

SceneActBench: Can Agents Act on the 3D Scenes They See?

Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu
任务设定 评测 VLM 智能体在 3D 场景中执行动作的能力
痛点动机 现有基准只评文本或单物体操作,缺乏多物体场景动作评测
解决方案 构建统一智能体-环境循环,涵盖五类 3D 任务共 520 个案例,用几何指标评估输出
5

SiPhy: Single-Image Physical Property Reasoning

Hoang Le, Joonwoo Kwon, Elkhan Ismayilzada, Yufei Zhang, Zijun Cui
任务设定 单张图像推理物体的物理属性(质量、刚度、弹性)
痛点动机 现有方法依赖多视角重建或物理仿真监督,难以泛化
解决方案 结合 CLIP 特征与 VLM 材料先验,构建伪体素点并做区域一致性聚合来估计属性
6

Time-Reversed Imaging: A Multimodal Benchmark and Framework for Reconstructing Past Human-Environment Interactions

Jorge Bacca, Kebin Contreras, Luis Toscano-Palomino, Mauro Dalla Mura
任务设定 从残留痕迹反推场景中刚发生的人-环境交互
痛点动机 传统方法只能预测未来帧,无法从衰减痕迹反推过去事件
解决方案 提出多模态数据集 TRACE-HEI ,用扩散模型结合结构化文本描述重建过去帧
7

AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment

Ziyao Huang, Shunkai Li, Juan Cao, Chenyu Li, Youliang Zhang, Zixiang Zhou, Cong Wang, Yuan Zhou, Qinglin Lu, Fan Tang
任务设定 根据文本生成人-物交互视频
痛点动机 现有方法依赖显式运动控制,难以泛化到新物体和交互
解决方案 多智能体推理先规划交互再生成,以隐式文本-运动对齐蒸馏运动先验,无需显式运动输入
8

One Hand Watches The Other: Dynamic Multi-Agent Cooperation for Sample-Efficient Bimanual Manipulation in Dynamic Environments

Jan Ole von Hartz, Abhinav Valada, Joschka Boedecker
任务设定 动态环境下双臂机器人协同操作任务
痛点动机 多流策略假设参考系外生,动态场景下该假设失效
解决方案 提出 DynaMAC ,将对侧机械臂视为动态任务参数,样本效率提升 20 倍
9

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano
任务设定 评测 MLLM 作为无人机具身智能体完成长时程任务的能力
痛点动机 尚不清楚通用 MLLM 能否仅凭单条高层指令解决多步骤具身任务
解决方案 提出 MissionBench 基准,仅用第一视角观测和动作历史评估自主规划与导航
10

ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset

Shashank Rao Marpally, Allan Wang, Atharva Ghotavadekar, Renato Alexandre Ribeiro, Nhat Le, Pilar Bachiller-Burgos, Pranav Goyal, Subham Agrawal, Yasuhiro Nitta, Howard Ziyu Han, Daeun Song, Masaki Kuribayashi, Kohei Uehara, Xiyue Wang, Yangzhe Kong, Duc M. Nguyen, Amirreza Payandeh, Gerardo Pérez-González, Alejandro Torrejón-Harto, Jeeho Ahn, Tisha Jain, Andrew Stratton, Elvin Yang, Jorge de Heuvel, Nico Ostermann-Myrau, Sai Anudeep Sajja, Mithilya Raj, Daisuke Sato, Gaston Rouquette, Nikolas Martelaro, Maki Sugimoto, Hironobu Takagi, Chieko Asakawa, Maren Bennewitz, Aaron Steinfeld, Xuesu Xiao, Christoforos Mavrogiannis, Harold Soh
任务设定 构建跨文化、多机器人形态的社会导航数据集
痛点动机 现有数据集缺乏文化地域多样性,难以体现社交行为差异
解决方案 在 5 国 8 地用 7 种机器人采集社会导航数据,含行人轨迹与场景交互标注
11

When Is a Learned Command Adapter Worth It? Closed-Loop Identification and Counterfactual Auditing of Frozen Locomotion Policies

Zongtan Li
任务设定 评估学习式命令适配器对冻结运动策略是否有实际价值
痛点动机 适配器改进量常无法从部署观测中真实恢复,需审计其必要性
解决方案 反事实审计比较部署增益与状态可恢复增益,输出 GO/NO-GO 决策
12

Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering

Wenchao Ma, Changran Liu, Sharon X. Huang, Haomiao Jiang
任务设定 自回归视频生成中相机重访旧场景的一致性问题
痛点动机 KV 缓存有限导致重访时外观不一致,即使深度对齐无误
解决方案 免训练地利用 3D 引擎给出的时空对应关系,检索历史帧作记忆并做注意力偏置校正
13

Persistent Computational State: A Session-Centric Runtime for Generative World Models

Zhen Lin
任务设定 生成式世界模型模拟器设计可恢复的会话级运行时
痛点动机 现有请求式服务丢弃不可重算的运行时状态,回溯会失真
解决方案 定义持久计算状态(PCS),构建会话式运行时实现毫秒级快照与恢复
14

Ordered Action Tokens for Visuomotor Policy Learning

Chaoqi Liu, Yue Zhao, Haonan Chen, Xiaoshen Han, Jiawei Gao, Ehsan Adeli, Yilun Du
任务设定 视觉运动策略学习中的机器人动作分词方法
痛点动机 现有离散化动作 token 序列过长或缺乏结构,难兼容下游策略
解决方案 提出有序动作分词(OAT),用量化+排序训练实现由粗到细的可解码 token 序列
15

Multi-Horizon Consistency as Geometry: When Latent Dynamics Contract, and When They Do Not

Kavya Bhand, Aadi Joshi
任务设定 研究世界模型中多步一致性损失对隐空间动力学几何的影响
痛点动机 从业者不清楚一致性损失权重如何改变状态转移的几何性质
解决方案 扩张率指标量化发现一致性损失能否使动力学收缩,效果因任务域而异