Daily Paper Feed

2026 年 08 月 11 日 星期二 · 共 42 篇相关论文 · 全部存档
1

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning

Haodong Li, Shaoteng Liu, Tianyu Wang, Chongjian Ge, Sihui Ji, Jiahan Zhang, Xin Lin, Haolin Lu, Zhe Lin, Manmohan Chandraker
任务设定 让视频世界模型准确外推物理动力学演化
痛点动机 扩散模型只拟合像素,学不到真实运动规律,分布外表现差
解决方案 提出潜在动力学推理,将潜在转移建模为运动学积分,仅需回归高阶残差
2

Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion Planning

Yapeng Liu, Yuanzhao Zhai, Bo Ding, Huaimin Wang, Lin Wang
任务设定 开放世界导航中生成物理一致的运动规划轨迹
痛点动机 现有隐世界模型不显式建模物理量,轨迹易失真难落地执行
解决方案 提出能量结构化隐世界模型显式携带能量动量,结合神经时间场生成导航策略
3

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li
任务设定 构建可扩展的机器人操作价值基础模型
痛点动机 现有奖励监督依赖任务内锚点,难跨具身与数据源迁移
解决方案 时间距离替代偏好标注作监督信号,转为密集奖励大幅提升策略成功率
4

HandSplatter: Automated Digital Goniometry from Neural Rendering

Emmett Chen, Neal Chen, Xiang Li, Quanzheng Li, Siyeop Yoon
任务设定 用神经渲染实现手部关节角度自动化测量
痛点动机 人工量角器耗时且评估者间一致性差,现有数字方案精度不足
解决方案 结合 2D 特征提取与视图合成做 3D 手部关节定位,配合密度爬山算法修正关键点
5

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling

Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng
任务设定 训练时用世界建模增强 VLA 策略,部署时保持高效推理
痛点动机 现有世界-动作模型保留视频生成分支,导致推理成本过高
解决方案 引入 World Adapter 将 VLM 特征转为世界 token ,联合训练视频去噪与动作预测,部署时去掉世界模型分支
6

EgoHieraLoc: A Cortically Inspired Hierarchical Segmentation-Guided Framework for Egocentric Visual Query Localization

Yifei Cao, Guolong Wang, Mingliang Hou, Xiya Bu, Daming Liu, Yu Liu
任务设定 第一视角视频中的视觉查询定位( 2D/3D )
痛点动机 目标边界模糊,全局上下文难以指导局部精细定位
解决方案 模仿人类分层感知:分割先验引导判别式解析与定位,几何-语义联合置信度融合多视角 3D 证据
7

Marrying Optimal Transport and ODEs for Unified Continuous-Time 4D Reconstruction and Tracking

Liying Yang, Hao Mo, Jialun Liu, Chen Liu, Xinxing Yu, Chenhao Guan, Hui Ma, Xiao Cao, Ajian Liu, Yanyan Liang
任务设定 统一 4D 重建与点跟踪,支持任意时刻连续预测
痛点动机 现有方法依赖启发式插值,仅在整数时间戳预测,缺乏运动一致性
解决方案 融合最优传输ODE 学习连续速度场作为运动先验,配合 Flow Matching 解码器实现跨时间戳重建
8

You Only Flow Once: Calibrated and Real-Time Radar Pose Estimation with Multi-Hypothesis Normalizing Flows

Jonas Leo Mueller, Sebastian Hoefler, Dario Zanca, Naga Venkata Sai Jitin Jami, Thomas Altstidl, Bjoern M. Eskofier
任务设定 从稀疏雷达点云估计人体姿态
痛点动机 点云噪声大姿态多解,扩散模型慢且校准差
解决方案 提出多假设归一化流,单次前向生成姿态分布,比扩散快 20 倍且校准误差降低 85%
9

PressureMesh: 3D Human Mesh Estimation from Multi-Device Pressure Images

Changhai Ma, Ziyu Wu, Yunkang Zhang, Fangting Xie, Mengting Niu, Heyu Ding, Quan Wan, Jiayue Yuan, Boyan Liu, Yi Ke, Xiaohui Cai
任务设定 多设备压力图像估计 3D 人体网格
痛点动机 单设备监测范围有限,压力感知隐私性好但难扩展
解决方案 提出 MoE 多设备融合机制,端到端从时序压力数据回归人体网格
10

verdi: retrieval is not transfer for continual world model optimization

Junyu Wu, Shiqin Nie, Youyi Kou, Baohua Yin, Guocai Yao, Qingyu Chen, Jingheng Ma, Shiji Zhou, Hongyong Song, Mingchen Zhuge, Sen Cui, Changshui Zhang
任务设定 持续优化预训练世界模型以适配新目标
痛点动机 每次任务从零摸索策略,经验难以跨模型迁移
解决方案 提出 VERDI 框架,构建优化指纹检索先验经验并验证后复用,节省 69% 算力
11

Sekai2: From World Exploration to Interactive World Modeling

Kang He, Wenshuo Peng, Zihui Gao, Jiaming Tan, Kaipeng Zhang, Yongtao Ge
任务设定 构建大规模真实视频数据集以支持交互式世界模型训练
痛点动机 现有数据集缺乏相机轨迹与时序语义标注,长时程一致性差
解决方案 发布 2826 小时多源视频,含相机轨迹与全景重访序列,支持长期空间记忆学习。
12

VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction

Hongjin Ji, Guoyang Xia, Luoyang Sun, Fangxiang Feng, Lei Ren
任务设定 解决 VLA 模型闭环操作中测试时训练不可靠的问题
痛点动机 在线更新可能在后果未知前就影响后续动作,风险大
解决方案 基于未来视觉观测验证候选更新,仅有支持证据才提交,保证适应可回退。
13

Efficient Human-Contact Representation for Human-Scene Interaction

Nghia Vu, Tuong Do, Binh X. Nguyen, Erman Tjiputra, Anh Nguyen
任务设定 面向人体-场景交互的接触表示与合成
痛点动机 现有接触表示存在数据冗余,计算效率低
解决方案 提出稀疏接触掩码筛选关键信息,配合稀疏算子替代密集运算,提速 12 倍以上
14

WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation

Peterson Co, Sicheng Hu, Chunxuan Jiao, Hongyang Cheng, Yulin Luo, Yijie Xu, Sixiang Chen, Zhongxia Zhao, Zihao Wang, DaFeng Chi, Peidong Liu, YuTong Chen, Henghua Liu, Zhihao Yuan, Huizhu Jia, Yuzheng Zhuang, Tianle Zhang, Liang Lin, Huajie Tan, Shanghang Zhang
任务设定 诊断动作条件世界模型在具身操作中的仿真保真度
痛点动机 现有评测只看视觉质量和任务结果,未验证动作-状态转移是否准确
解决方案 提出 Observable Simulator Contract 与 WorldSimProbe 基准,五套件评测动作-运动对应及交互 grounding
15

RealDenseFace: Real-time Monocular 3D Face Reconstruction from Dense UV-space Priors

Linzhou Li, Tianjia Shao, Kun Zhou
任务设定 基于稠密 UV 空间先验的单目实时 3D 人脸重建
痛点动机 传统优化方法拟合 3DMM 需数十秒,速度太慢
解决方案 网络预测 UV 空间对应图与深度图,再用定制高斯牛顿求解器几次迭代快速拟合 3DMM。
16

UniMoFlow: Grounding Instruction-Driven 3D Human Motion Editing in Generation

Yilei Hua, Beibei Jing, Ce Zheng, Hanyu Zhou, Yawei Luo, Wei Yang
任务设定 根据指令编辑 3D 人体动作序列
痛点动机 现有方法可控性差,或编辑数据集规模小、语义单一
解决方案 构建大规模编辑数据集,提出统一流匹配模型联合生成与编辑,配合源锚定推理精细控制
17

SpeedTuning: Speeding Up Policy Execution with Lightweight Reinforcement Learning

David D. Yuan, Tony Z. Zhao, Kaylee Burns, Chelsea Finn
任务设定 提升模仿学习机器人操作策略的执行速度
痛点动机 模仿学习策略速度受限于人工采集数据,缺乏提速方法
解决方案 提出轻量强化学习框架预测最优执行速度,无需额外数据即可提速 2.4 倍
18

Learning human joint torques from pixels

Chen Chen, Rui Cheng
任务设定 从单目 RGB 图像预测人体关节力矩
痛点动机 传统方法依赖肌电、动捕标记等,难以用于普通图像
解决方案 构建 VID 数据集VID-Network ,结合姿态预训练特征与时序力矩推断
19

Zero-shot 2D Grounding with Novel Affordance Types

Haomeng Zhang, Raymond A. Yeh
任务设定 零样本定位新可供性类型的物体可交互区域
痛点动机 已有方法只认识训练时见过的可供性,难以泛化到新类型
解决方案 提出免训练方法 AffordAnything,借助分割线索定位交互区域,并推出可学习版 AffordAnything+
20

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou
任务设定 探测 VLA 模型动作后训练后各层的深度感知能力
痛点动机 动作后训练是否损害 VLM 原有空间/深度理解尚不明确
解决方案 逐层探测深度可解码性,发现 VLA 深层出现骤降,并定位为晚层 MLP 写入干扰所致
21

SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models

Junjie He, Junfeng Li, Zhide Zhong, Haodong Yan, Ruixin Li, Yangyang Zheng, Jiaguan Zhu, Tianran Zhang, Yuqiao Du, Wen Chen, Shunbo Zhou, Haoang Li
任务设定 World-Action Model 驱动的机器人操作任务
痛点动机 现有 WAM 主要靠视觉线索,预测视频与语言指令语义错位
解决方案 训练 VLM 语义规划器,生成文本关联和空间感知的语义预见,指导视频与动作生成
22

360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents

Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa, Kiyoharu Aizawa, Toshihiko Yamasaki
任务设定 评测具身智能体的城市级导航与空间推理能力
痛点动机 现有户外基准真实感或复杂度不足,与真实城市环境差距大
解决方案 基于东京秋叶原 360 度视频构建逼真城市环境,设计 175 个人工标注任务
23

OccAnyScene: Towards Unified Indoor-Outdoor 3D Occupancy Predictio

Junjie Liu, Wanshui Gan, Zitong Dai, Guiping Cao, Yan Li, Ke Chen, Dongmei Jiang, Xiangyuan Lan, Jianguo Zhang
任务设定 统一室内外场景的 3D 语义占据预测
痛点动机 现有方法局限特定场景类型,难以跨室内外泛化
解决方案 基于深度基础模型,用像素锥体高斯框架实现跨场景自适应的图像到 3D 提升
24

Population-Scalable Multi-Agent World Modeling

Renjie Zhao, Yuxiang Wu, Mingyu Zhang, Jiaxin Li, Sisi Li, Yimin Sheng, Tianxi Tan, Zhenkai Zhang, Jianyi Zhu, Yong-Lu Li
任务设定 多智能体环境下可扩展的世界模型视觉预测与生成
痛点动机 现有方法绑定固定智能体数量,推理时无法扩展
解决方案 提出 Khora ,解耦世界状态演化与视图渲染,支持任意数量智能体推理时扩展
25

Goal-oriented Navigation Instruction Generation with Tour Video Priors

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao
任务设定 第一人称导览视频生成目标导向的导航指令
痛点动机 现有方法依赖图/地图等中间表示,精细空间推理仍具挑战
解决方案 提出 VideoNIG 任务及两阶段课程学习框架,先学动作感知再学长程导航推理
26

Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization

Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu
任务设定 多模态具身智能体的长时程任务规划
痛点动机 单一规划风格易卡死,无法应对执行中的停滞失败
解决方案 质量-多样性优化构建多样化规划策略档案,检测到卡顿时切换到不同策略
27

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang
任务设定 机器人长时程操作任务的奖励模型构建
痛点动机 现有 VLM 奖励模型点式打分与两两偏好不一致,引入训练噪声
解决方案 提出 POISE 用保序回归校准点式分数,消除点式-两两偏好打分冲突
28

Ego-OSCAR: Egocentric Open source Stereo CAptuRe System

Gunjan Paul, Senthil Palanisamy, Satpal Singh Rathore, Pratyush Kumar Patnaik, Shubhanshu Khatana, Abhishek Anand
任务设定 开源低成本头戴式双目+IMU 第一视角数据采集设备
痛点动机 专业级采集设备成本高,难以支撑大规模众包式数据采集
解决方案 成本低于 200 美元的开源硬件+软件栈,发布 550 小时标注视频与逐帧 3D 手部重建数据
29

Action- and Language-Conditioned Video Assessment for Embodied Control

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo
任务设定 评估具身智能体执行多步指令的轨迹级完成进度
痛点动机 末帧匹配或嵌入相似度难以判断指令是否真正完成
解决方案 VLM 先总结动作条件下的视觉转变,再据此评分,用作闭环策略优化反馈信号
30

Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?

Gabriele La Malfa, Nitay Alon, Emanuele La Malfa, Reuth Mirsky, Stefan Sarkadi
任务设定 评测具身 VLM 在安全关键场景下的空间推理与决策能力
痛点动机 VLM 决策可能依赖文本先验而非真实空间证据,存在未知风险
解决方案 提出 EMRD 框架,从探索、建图、空间记忆、决策四环节量化评估
31

PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets

Jie Huang, Xiaohe Li, Jiahao Li, Fangli Mou, Chen Qian, Yuqiang Fang, Junhao Fan, Kaixin Zhang, Zide Fan
任务设定 从单张图像生成可仿真的 3D 资产
痛点动机 现有方法几何隐式纠缠,物理推理不可监督
解决方案 提出结构化物理推理链,显式建模部件级状态并用 CoT-GRPO 优化生成
32

Lingjing: A Simulation Testbed for Multi-Agent Embodied Tasks in Open-Ended Cities

Xiaohe Li, Yiru Wang, Junhao Fan, Mingyuan Liu, Jie Huang, Kaixin Zhang, Jiahao Li, Chen Qian, Zide Fan
任务设定 构建开放城市中异构多智能体具身任务仿真平台
痛点动机 现有仿真器割裂不同实体,难以支持协同评测
解决方案 提出 Lingjing 平台,重建动态城市场景,支持 UAV/地面机器人协同任务
33

EgoTrack3D: A Modular Framework for Egocentric 3D Object Tracking

Jan Kulik, Bjarni Dagur Thor Karason, Yung-Hsu Yang, Boyang Sun, Marc Pollefeys, Xi Wang
任务设定 第一视角视频中的动态 3D 物体跟踪
痛点动机 视角快速变化和遮挡使动态 3D 场景表示难以维持
解决方案 提出 EgoTrack3D 框架,将 2D 掩码提升至 3D 并用体素合并关联物体轨迹
34

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang
任务设定 构建人体动作-文本检索综合评测基准
痛点动机 现有基准动作单一、文本过简,难测跨域细粒度对齐
解决方案 多阶段构建含多粒度描述的 MRBench,并提出粒度感知检索模型
35

Distilling Physical Priors into Streaming World Models

Liangliang Zhao, Junying Wang, Danni Yang, Yifan Chang, Bin Fu, Yu Qiao, Bowen Zhou, Yihao Liu
任务设定 流式世界模型的预测长期遵循物理规律
痛点动机 双向教师物理先验不足,蒸馏为因果模型时又进一步流失
解决方案 真实物理交互视频微调教师并蒸馏为轻量因果模型,再以强化学习校正物理合理性
36

SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li
任务设定 超长第一人称视频的多跳工具式推理理解
痛点动机 固定放大策略易累积错误,且缺乏恢复机制
解决方案 提出自检查门控动态权衡放大与切换区域,配合不确定性优先 RL 训练
37

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

Chen Li, Sijie Cheng, Yuelin Zhang, Junxi Li, Maozhi Huang, Yang Liu, Wenbing Huang
任务设定 基于 LLM 的长时程具身任务规划
痛点动机 LLM 规划易出现物理幻觉,长时任务泛化和环境感知弱
解决方案 引入任务图引导推理并做 GRPO 奖励设计,结合场景图实现事件驱动重规划
38

SpikeWorld: Fast-State Adaptation for Frozen Spiking World Models

Ziqiao Yu
任务设定 让冻结的脉冲世界模型在部署后快速适应新的状态变化
痛点动机 更新权重需优化器状态且可能破坏已学表征,难以在线适应
解决方案 全部参数冻结,仅用外部残差路径在推理时修正下一状态预测与动作校正
39

CosmosAlign: Adapting a World Foundation Model for Generative Traffic Video Forecasting

Quang Minh Dinh, Tuan Kiet Doan
任务设定 基于世界基础模型生成长时程交通场景预测视频
痛点动机 直接扩容或微调大模型代价高,关键在于分布对齐而非算力堆砌
解决方案 提出两阶段 LoRA 对齐策略,配合无需训练的推理时一致性采样
40

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng
任务设定 研究 VLA 模型中 VLM 中间特征到动作解码器的路由方式
痛点动机 现有方法仅用单层特征或刚性对齐,浪费跨深度互补信息
解决方案 提出 LIRA 深度感知跨层路由机制,用并行融合模块聚合多层 VLM 特征生成动作
41

Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning

Shilin Shan, Chuhao Zhou, Ruize Wang, Xinyan Chen, Xiangyu Chen, Xinyu Zhou, Boyu Ma, Iris Yuxuan Hu, Jingliang Li, Celeste Yuxuan Hu, Geng Li, Guohao Chen, Tianrui Zhu, Zhe Li, Yanjie Ze, Haoran Geng, Zhiyang Dou, Jianxin Bi, Yuejiang Liu, Jianshu Zhou, Jiachen Li, Paul Liang, Tatsuya Harada, Robert Katzschmann, Harold Soh, Na Li, Edward Johns, Danica Kragic, Jan Peters, Wojciech Matusik, Masayoshi Tomizuka, Jitendra Malik, Jianfei Yang
任务设定 综述机器人触觉与力觉感知的接触式操作学习方法
痛点动机 现有综述缺乏统一整合多模态感知与系统设计的视角
解决方案 提出 TF-ART 分类法,统一归纳多模态感知融合与多阶段动作生成架构
42

SC$^{2}$-WM: A Self-Correcting World Model with Closed-Loop Feedback for Vision-and-Language Navigation in Continuous Environments

Xuan Yao, Yuze Zhu, Junyu Gao, Zongmeng Wang, Changsheng Xu
任务设定 连续环境下的视觉语言导航( VLN-CE )决策问题
痛点动机 现有方法多为开环执行,无法检测和修正推理时的状态漂移
解决方案 提出自纠正世界模型 SC2-WM ,用世界模型前瞻做闭环反馈修正规划