Daily Paper Feed

2026 年 08 月 10 日 星期一 · 共 22 篇相关论文 · 全部存档
1

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai
任务设定 端到端自动驾驶中的世界动作模型规划
痛点动机 现有 WAM 推理时需生成未来帧,成本高昂
解决方案 仅将视频生成用作训练信号,与轻量动作专家联合训练,推理时舍弃视频分支直接出轨迹
2

UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian
任务设定 统一图像级与视频级的世界模型表征学习
痛点动机 现有 JEPA 方法各自割裂,难以统一图像/视频建模
解决方案 共享隐空间联合学习光度与时序预测,支持动作条件下的零样本规划
3

Addressable Memory for Video World Models

Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep
任务设定 解决视频世界模型长程生成的记忆检索问题
痛点动机 超出训练时长后 RoPE 位置编码失效,记忆无法被检索
解决方案 提出 WorldTrace 免训练框架,给压缩记忆分配可寻址虚拟位置
4

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell
任务设定 分析驾驶 VLA 模型中规划 token 的层级表征
痛点动机 不清楚动作生成究竟需要多深的语言模型
解决方案 轨迹空间 logit lens 逐层解码规划 token ,剪枝 8/32 层仅增约 5%误差
5

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models

Ziheng Liu, Quantao Yang
任务设定 用强化学习对 VLA 模型做后训练以适配机器人操作
痛点动机 现有 RL 方法统一更新各模块,忽略了语义与动作的不同角色
解决方案 冻结视觉语言骨干,语义投影层与动作专家采用双时间尺度分别更新
6

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li
任务设定 连续视觉语言导航( VLN )中构建世界导航模型
痛点动机 现有方法未将未来观测和动作生成建立在 3D 场景几何表示上
解决方案 先用几何编码器提取历史观测的 3D 特征转成 token 前缀,条件化扩散模型生成未来视频与动作
7

Representation Handoffs for OpenArm-Based Laboratory Mobile Manipulation

Yang Shen, Chonghao Cheng, Ziyi Zhao, Jialuo Zhu, Zhenyi Yi, Qi Zhao, Jian Yang, Yuhui Shi, Chin-Teng Lin
任务设定 面向实验室任务的双臂移动操作机器人原型
痛点动机 语言指令到安全动作的可靠对齐仍是难题
解决方案 提出表征交接机制,将指令约束为技能调用,感知锚定物体位姿并编译为可执行动作
8

InstanceSplat: Instance-Aware Feed-Forward 3D Gaussian Splatting for Scene Understanding

Minchao Jiang, Xiaoxuan Ma, Shunyu Jia, Haoru Wang, Zhang Liang, Wentao Zhu
任务设定 无位姿多视角图像的前馈 3D 重建与实例理解
痛点动机 现有方法多逐场景优化,重建与语义割裂
解决方案 提出 InstanceSplat 统一前馈 3DGS 框架,联合建模外观、几何、实例与语义
9

LifelongCrossNav: Persistent 3D Semantic Memory for Cross-Floor Multi-Object Navigation

Zehui Li, Zihao Sun, Jiawei Xu, Zheqi He, Xiaoqiang Zhang, Jing-Shu Zheng, Lu Liu, Dahui Gao, Xiuwan Chen
任务设定 未知多楼层室内环境中的连续多目标导航任务
痛点动机 以往方法割裂处理多目标记忆与跨楼层导航能力
解决方案 维护持久化 3D 语义体素记忆,结合楼梯感知实现统一跨楼层导航策略
10

AutoIntervene: Calibrated Intervention for Action-Chunking Imitation Learning Policies

Jinhe Tang, Weiming Zhi
任务设定 动作分块模仿学习策略部署中的人机控制切换
痛点动机 策略偏离示教分布时仍输出平滑但错误的动作
解决方案 视觉-动作支持记忆评估动作块,双向校准阈值自动切换策略与操作员控制
11

C2Dex: Contact-Consistent Reconstruction and Retargeting for Dexterous Manipulation from Monocular Video

Jie Ren, Zhehao Jiang, Yinhong Yang, Haorui Jia, Han Jiang, Ben Li, Yao Yao, Cheng Lin, Qiu Shen, Zhenshan Bing, Xiao-Xiao Long, Xun Cao
任务设定 从单目视频重建并迁移灵巧手操作演示
痛点动机 单目重建接触不稳定,跨手型迁移难保接触几何
解决方案 规范物体空间聚合稳定接触,结合拉普拉斯优化和残差 RL 迁移到灵巧手
12

Scenix: Sparse-View 3D Scene Reconstruction via Executable Scene Programs

Kai Li, Lutao Jiang, Zhenyang Li, Jiayu Dong, Jierui Zhang, Yingda Yin, Runze Zhang, Kai Yan, Xiaoyang Huang, Keyang Luo, Xin Wang, Xiangyu Zhao, Weikai Chen
任务设定 稀疏视角下重建可编辑的 3D 室内场景
痛点动机 现有方法依赖密集视角或人工标注先验,难以泛化
解决方案 预测可执行场景程序,通过感知驱动的资产实例化和闭环空间优化重建场景
13

Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models

Xiangkai Ma, Yue Ma, Junjie Wang, Sheng Xu, Mingyang Li, Han Zhang, Yuzheng Zhuang, Wenzhong Li, Zhihao Yuan
任务设定 统一建模世界状态演化与机器人动作生成
痛点动机 现有方法视觉与动作分支表征纠缠,监督信号稀疏
解决方案 提出 PILOT 框架,用状态转移 CoT 显式解耦高层语义与底层轨迹
14

R2S-EGO: Dual-Proxy Refinement for Sparse-Capture Real-to-Sim

Shuai Fang, Xin Deng, Yuchen Kang, Zhenjiang Li, Jie Chen
任务设定 机器人第一视角场景的稀疏采集 real-to-sim 重建
痛点动机 密集多视角采集成本高,稀疏采集难覆盖机器人行为视角
解决方案 双代理(机器人代理+几何代理)生成伪观测精修场景资产,在 Unitree G1 人形机器人上验证坐下策略成功率大幅提升。
15

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models

Haodong Yan, Jiaguan Zhu, Mingyuan Jia, Ruiqing Yin, Junjie He, Zhide Zhong, Junfeng Li, Jinxuan Lu, Hengtao Li, Tianran Zhang, Jiayi Chen, Wenxuan Song, Wen Chen, Yuxiang Gao, Haoang Li
任务设定 JEPA 世界模型的潜变量对应机器人物理状态
痛点动机 纯前向预测无法保证潜空间可辨识状态,限制规划与策略
解决方案 本体感知状态多步关节角变化做双重接地监督,仅训练期使用不增加推理成本
16

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren
任务设定 构建可控的手术世界模型,生成器械-组织交互视频
痛点动机 多模态条件直接融合易导致解剖畸变和时序不一致
解决方案 层级手术锚点保持场景一致性,多模态控制专家分阶段融合驱动视频扩散模型
17

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence

Ying Chen, Weizhen Li, Zhe Hu, Zhenjiang Li, Rui Jiang, Zhifeng Gu, Lihuang Fang, Jiangping Liu, Lei Yi, Jie Chen
任务设定 构建面向具身智能的执行中心视觉语言模型
痛点动机 现有方法按任务孤立训练能力,难以支撑迭代执行闭环
解决方案 按空间推理、时序理解、动作指导、状态验证四类分别强化学习训练专家,再权重合并+蒸馏统一
18

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu
任务设定 单腕相机下长时程、部分可观测的 VLA 机器人操作
痛点动机 物体出视野后感知遗忘,多步任务中进度也会遗忘
解决方案 提出双记忆架构( 4D 世界状态记忆+自我状态记忆),条件化扩散 Transformer 做主动空间推理
19

Dueling World Models: Advantage-Style Action Channels for Common-Mode Distractor Rejection

Jiazhuo Li, Yiming Fei, Zhiruo Zhou, Heikichi Hayashi
任务设定 含不可控干扰运动场景下的世界模型动作预测
痛点动机 干扰运动会让世界模型对动作预测'失明',不同动作预测变得难以区分
解决方案 借鉴 dueling 价值分解,减去动作预测的均值效应,分离出纯净的可控动作通道
20

TaskSense: Focusing on What Matters in World Models

SM Mazharul Islam, Manfred Huber
任务设定 视觉控制任务中的 世界模型 表征学习
痛点动机 全图重建使潜在表征被 无关背景 稀释
解决方案 随机空间注意力 聚焦任务相关区域,仅重建该区域并辅以逆动力学目标
21

LyEvO: Lyapunov-Guided Evolutionary Optimization for Safe and Robust Sim-to-Real Policy Learning

Riccardo Curcio, Hongpeng Cao, Marco Caccamo
任务设定 Sim-to-real 策略学习的安全性验证
痛点动机 仿真训练的控制器难保证真实世界中安全鲁棒
解决方案 结合 Lyapunov 稳定性分析进化优化 及统计模型检验,迭代扩展可验证安全区域
22

TRACE: Ergodic Trajectory Optimization for Active Scene Reconstruction

Ziyue Zheng, Linli Shi, Bingkun He, Wen Jiang, Ziyun Wang
任务设定 基于 高斯泼溅 的主动 3D 场景重建规划
痛点动机 贪心式次优视角选择导致重建轨迹效率低
解决方案 建模为 遍历覆盖问题,用核遍历轨迹规划器匹配全局信息分布