Daily Paper Feed

2026 年 08 月 07 日 星期五 · 共 26 篇相关论文 · 全部存档
1

MASS: Multiplayer World Models with Authoritative Shared State

Ziqi Cai, Siqi Yang, Yimu Wang, Zixian Gao, Yunheng Liu, Shuchen Weng, Erwin Wu, Kaipeng Zhang, Boxin Shi
任务设定 多智能体场景下视频世界模型的状态建模与多视角渲染
痛点动机 现有模型将全局状态与视角画面纠缠,导致视图不一致、计算冗余
解决方案 解耦出权威共享状态,逻辑引擎推演全局状态,渲染引擎再按需生成各视角画面
2

HOPE: Hand-Object Pressure Estimation from Monocular Videos

Subin Jeon, Byungjun Kim, Hanbyul Joo
任务设定 从单目视频估计手与物体交互的接触压力
痛点动机 现有视觉压力估计局限于平面、单帧,难适配多样物体动态交互
解决方案 建模为手部中心的视频预测任务,用顶点锚定视频 Transformer 在手部网格上预测逐点压力与接触
3

Prior-SG: Task and Prior Driven Region Segmentation for Scene Graphs in Arbitrarily-Structured Environments

Giorgio Tonetti, Laurent Kneip, Abel Gawel, Marco Hutter
任务设定 机器人探索中构建层次化 3D 场景图
痛点动机 开放式环境无墙体分隔,纯几何先验方法易失效
解决方案 LLM 生成先验图引导马尔可夫随机场融合多模态线索做区域分割
4

BendTwin: Robust Dense-to-Sparse Physical Reconstruction with Bending-Aware Differentiable Spring-Mass Models

Yixiong Jing, Qi Wang, Lin Chen, Junwei Jiang, Guangming Wang, Haibing Wu, Olaf Wysocki, Wanli Ma, Brian Sheil
任务设定 从视频重建可形变物体的物理属性
痛点动机 纯轴向弹簧质点模型稀疏化后约束不足,形变不稳定
解决方案 引入弯曲刚度约束扩展弹簧-质点模型,提升物理重建稳定性
5

iARCS: Iterative Agentic RL for Controllable 3D Scene Generation

Saugat Adhikari, Ashok Prasad Neupane, Pramish Paudel, Ajad Chhatkuli, Danda Pani Paudel
任务设定 按自然语言任务需求可控生成 3D 场景
痛点动机 现有生成器只顾视觉真实感,难保证可达性等功能约束
解决方案 智能体强化学习结合 LLM 生成奖励程序迭代微调场景生成器
6

Visual Grounding in Zero-Shot Vision-Language Control

J. de Curtò, Dayani Plasencia, Diego Sánchez, I. de Zarzà
任务设定 评测视觉语言模型作为零样本控制器的视觉依据可靠性
痛点动机 高分控制轨迹未必真正基于视觉感知,可能靠先验蒙对
解决方案 设计输入消融实验(盲图、镜像翻转等)检验 VLM 控制的视觉接地能力
7

Patient Pose Assessment Using a CT-Based Framework for Synthetic Data Generation

Manuel Laufer, Dominik Mairhöfer, Malte Sieren, Hauke Gerdes, Fabio Leal dos Reis, Arpad Bischof, Thomas Käster, Erhardt Barth, Jörg Barkhausen, Thomas Martinetz
任务设定 放射摄影前评估患者体位姿态
痛点动机 真实深度图-X 光配对数据因监管限制难以获取
解决方案 基于 CT 扫描合成深度图训练数据,预训练提升真实姿态评估精度
8

Wan-Animate-2: Pushing the Application Boundaries of Character Animation

Guangyuan Wang, Li Hu, Dechao Meng, Zhongyi Zhang, Peng Zhang, Mingyang Huang, Ruoshi Zhang, Ke Sun, Zhe Zhang, Xingjun Wang, Gang Cheng, Bang Zhang
任务设定 端到端角色动画生成,直接由驱动视频驱动
痛点动机 现有方法运动失真、身份漂移或计算量大,且无法实时
解决方案 Diffusion Transformer 直接消费驱动视频生成,蒸馏出实时版 Wan-Animate-2-Lite
9

TRACE: Learned Proprioceptive Odometry for Legged Robots under Unreliable Contact Conditions

Taehyeon Kong, Woojin Kim, Jemin Hwangbo
任务设定 足式机器人在不可靠接触下的本体感知里程计估计
痛点动机 传统接触判定依赖人工阈值,抗滑移能力差
解决方案 跨注意力融合 IMU 与关节数据,仿真训练后真实微调提升泛化
10

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tang, Jiwen Lu
任务设定 组合式具身操作任务中的技能复用问题
痛点动机 轨迹数据稀缺导致模型难以泛化到分布外组合任务
解决方案 MoE 隐式分解演示为原子技能,建立情景记忆库检索融合以优化动作
11

GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models

Shuai Wang, Yaxin Feng, Xuekun Jiang, Shihan Tian, Ningyu Yan, Xing Shen, Chaoyang Lyu, Hui Wang, Yunsong Zhou, Hanqing Wang, Jiangmiao Pang, Yang Xiang, Xing Gao, Chunhua Shen, Weinan Zhang
任务设定 评测物理仿真引擎与视频世界模型的物理保真度
痛点动机 现有评估依赖感知相似度或人工判断,难以定位具体物理误差
解决方案 构建 22 类真实轨迹标定任务,用校准指标联合诊断仿真器与图生视频模型
12

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li
任务设定 基于预训练视频生成模型构建世界-动作模型用于机器人控制
痛点动机 VAE 隐空间为像素重建优化,视觉偏移下动作预测易失效
解决方案 保留 VAE 生成路径,加入可学习查询 token 对齐未来帧语义以增强动作鲁棒性
13

Ordered Diffusion for 3D Human Registration

Mattia Masiero, Ilya A. Petrov, Daniel Cremers, Gerard Pons-Moll, Riccardo Marin
任务设定 3D 人体扫描点云与模板的配准任务
痛点动机 回归方法忽略配准存在歧义性,易得到不合理的平均几何
解决方案 提出 ODin ,将配准建模为扩散过程,用多重条件生成保持点序语义的对齐点云
14

XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments?

Yixiang Chen, Jiabing Yang, Yuan Xu, Qisen Ma, Keji He, Peiyan Li, Kai Wang, Ziheng He, Xiangnan Wu, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang
任务设定 评估世界模型能否泛化到未见过的机器人本体
痛点动机 现有模型仅测训练机器人,难辨是学到物理规律还是记住视觉模式
解决方案 提出 XEWorld 跨本体测试基准,发现模型本质是 2D 视觉模式匹配器
15

SR-JEPA: Learning Predictive Latent State in 3D Scenes

Zihan Zhou, Qifu Wen, Xi Zeng
任务设定 在 3D 场景点云中预测被移除物体的潜在表征
痛点动机 以往 JEPA 只评估编码器,未探究预测头本身能否推理场景
解决方案 提出 SR-JEPA ,仅用 3D EMA 自监督目标训练点云预测通路,查询缺失物体的潜在状态
16

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li
任务设定 评测 VLM 能否从视频获得全局空间感知能力
痛点动机 现有基准只测局部空间感知,忽略长视频下的全局一致理解
解决方案 构建 GST-Bench 基准与 GST-Train 数据集,检验模型能否将自我中心观察整合为全局俯视场景表征
17

PhyLatent: Learning Dynamics-Relevant Representations for JEPA World Models

Xi Zeng, Haojie Ren, Ziying Song
任务设定 学习 JEPA 世界模型 中动力学相关的潜在表示
痛点动机 仅避免潜在坍缩不能保证表示保留物理状态和动作后果
解决方案 提出物理不变性、可辨识性、反事实动力学三条训练路径,显著提升 MPC 规划成功率
18

LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

Jiarui Yang, Jiale Zhange, Jiawei Li, Hang Guo, Wen Huang, Jinpeng Wang, Peidong Liu, Shu-Tao Xia
任务设定 从人类视频学习 3D 感知潜在动作 构建机器人世界模型
痛点动机 多视角直接训练潜在动作模型仍是 2D 像素级,缺乏 3D 几何感知
解决方案 提出多视角不变动作分词几何对齐约束,结合 RGB-D 联合重建避免外观泄露捷径
19

Uncertainty-Aware World Model for Aerial Image-Goal Navigation

Deyi Zhu, Haoyu Fan, Yinan Zhu, Weichen Zhang, Shilin Ma, Xinlei Chen, Yansong Tang
任务设定 无人机依据目标图像进行空中导航
痛点动机 户外场景未来状态不确定,单点预测评分轨迹不可靠
解决方案 提出不确定性感知世界模型,用分布外检测评分轨迹,无需多次采样未来
20

CoordRefer: Coordinate-Aware 3D Visual Grounding from Multiview Images

Haijie Li, Jiaxin Zhang, Dave Zhenyu Chen, Youyu Chen, Yanmin Wu, Jian Zhang
任务设定 多视角图像的 3D 视觉定位任务
痛点动机 坐标系选择与边界框回归联合优化导致框预测存在歧义
解决方案 提出 CoordRefer 框架,先选坐标系再条件化回归 3D 框,并用 GRPO 强化对齐
21

HERA: Historical Evidence Routing Adapter for Physical Prediction in Latent World Models

Yuanruyi, Yue Cao, Haojia Gao, Guanqiu Guo, Ziyuezhang, Shangqin, Junbo Tan, Bokui Chen, Zhuo Zou, Xueqian Wang
任务设定 世界模型中遮挡场景下的物理事件预测
痛点动机 历史证据虽被保留,但后续预测时难以被检索利用
解决方案 提出 HERA 适配器,用记忆库+寄存器为冻结预测器路由历史证据
22

DynaPix: Can Vision-Language Models Identify the Exact Future?

Thong Nguyen, Vinh-Hien Do, Quynh Vo, Cong-Duy Nguyen, See-Kiong Ng
任务设定 评测视觉语言模型预测未来物理状态的能力
痛点动机 现有评测仅凭文字或逼真图像,未核对真实未来状态
解决方案 构建物理仿真基准 DynaPix ,让模型从候选图库中挑出真实未来帧
23

World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

Yuhao Pan, Haosong Peng, Zhengshen Zhang, Zhengyang Yan, Yalun Dai, Fushuo Huo, Chujie Wang, Tianyu Qi, Xiucheng Wang, Nan Cheng, Wenchao Xu
任务设定 细粒度机器人操作中融合主视角与腕部视角信息
痛点动机 现有 VLA 割裂处理两视角,难以捕捉腕部接触动态变化
解决方案 提出 W2-VLA ,用潜在 token 预测未来腕部特征来指导动作生成
24

Disentangling 3D Modeling from Spatial Reasoning

Haoze Sun, Jiequan Cui, Qingshan Xu, Richang Hong
任务设定 空间推理任务中解耦 3D 感知与语言推理
痛点动机 端到端联合学习 3D 感知与推理导致可解释性差、效率低
解决方案 专家感知模型重建 3D 几何证据,再 LoRA 微调 LLM 仅基于该证据推理
25

PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

Ao Fu, Yi Zhou
任务设定 音频驱动 3DGS 说话人头像的唇形生成
痛点动机 连续声学特征回归易致唇部过平滑、出现'漏嘴'伪影
解决方案 引入帧对齐音素 token,用语言融合模块门控融合音频与音素信息
26

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

Jihoon Oh, Kento Kawaharazuka, Kei Okada
任务设定 从第一人称人类视频学习跨本体操作可供性
痛点动机 人机形态差异大,人类操作技能难以直接迁移给机器人
解决方案 SfM 与手部网格重建提取视觉/抓取/轨迹可供性,训练统一视觉-语言-可供性模型