Daily Paper Feed

2026 年 08 月 25 日 星期二 · 共 39 篇相关论文 · 全部存档
1

ReWorld: An Interactive World Model with Long-Horizon Memory

Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen
任务设定 交互式世界模型的长时记忆与实时视频生成
痛点动机 控制需短时程记忆需长时程,二者结构性矛盾
解决方案 训练时用混合注意力窗口分离两种能力,推理时用位姿索引地标库限定有界内存,蒸馏至四步实时生成
2

FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors

Khiem Vuong, Deva Ramanan, Srinivasa Narasimhan
任务设定 修复稀疏视角下 3D 渲染的伪影
痛点动机 现有修复方法局限于特定 3D 表示,需定制架构重训练
解决方案 复用预训练视频生成模型做视频到视频翻译,用掩码锚定保留干净像素,并以位姿一致性做 DPO 优化
3

Correcting a learned physical invariant improves world-model rollouts

Richard Bao
任务设定 检验并修正世界模型内部的物理不变量
痛点动机 世界模型预测视频时可能并未真正遵守物理规律
解决方案 通过无标签搜索找到类能量的不变量,推理时把隐状态投影回初始能级以降低漂移误差
4

GeoWAM: Visual Geometry World Action Models for Autonomous Driving

Yiren Lu, Xin Ye, Jiaming Liu, Jin Yao, Yi-chung Chen, Liam Merino, Dhruva Dixith Kurra, Min Cai, Tom Lampo, Yu Yin, Danhua Guo, Burhan Yaman
任务设定 自动驾驶中联合预测场景演化与自车轨迹
痛点动机 像素纠缠外观与几何,难以还原 3D 场景动态
解决方案 点云几何代替像素预测未来场景,再用几何条件动作头推算轨迹
5

Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models

Sangoh Lee, Sangwoo Mo, Wook-Shin Han
任务设定 让 VLA 模型的动作解码器学习行为背后的意图
痛点动机 单纯行为克隆学不到动作背后的语义目标
解决方案 用冻结教师 VLM 提取行为意图,蒸馏进动作解码器辅助预测
6

Reward-Free Continual Adaptation for Resilient Space Robots

Andrej Orsula, Miguel Olivares-Mendez, Carol Martinez
任务设定 太空机器人在硬件损坏后的在线适应
痛点动机 太空中缺乏外部跟踪,难以计算真实奖励信号
解决方案 预训练世界模型学习奖励结构,仅用想象轨迹更新动力学和策略
7

Photorealistic Novel View Synthesis of Human Faces using Next-Scale Transformers

Federico Stella, Fei Jiang, Zhongshi Jiang, Zohar Barzelay, Emanuel Garbin, Amin Jourabloo, Liuhao Ge
任务设定 高分辨率多视角人脸新视角合成
痛点动机 扩散模型需 2D 预训练,多相机一致性难保持
解决方案 下一尺度自回归架构替代扩散模型,结合多视角 3D 高斯完成重建
8

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang
任务设定 长时长音视频叙事生成与交互式世界导航
痛点动机 长视频生成难保持角色身份、语音与相机稳定性
解决方案 提出 JoyAI-Echo-1.5 统一系统,用跨镜头记忆保持角色一致,6-DoF 轨迹控制相机漫游
9

OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation

Alperen Avan, Jordi Sanchez-Riera
任务设定 室内自主导航:融合语义理解与几何控制
痛点动机 纯 VLM 导航慢且不精确,稠密建图成本高
解决方案 提出 OptiSight 框架,用 Grounded-SAM 定位目标,视觉伺服几何控制降低 VLM 调用频率
10

Spatiotemporally Decoupled Autoregressive Diffusion Model for Human Motion Generation

Chengqun Yang, Liang Xu, Yanping Li, Fulong Liu, Jingnan Gao, Weili Zeng, Yichao Yan
任务设定 文本驱动的人体运动生成任务
痛点动机 VQ 离散化丢失信息,整体表示缺乏部位可控性
解决方案 提出时空解耦框架,关节级 VAE 结合自回归扩散实现可控生成
11

Progressively Learning Heterogeneous Skills in a Unified Latent Space

Yue-Yi Zhang, Ming Gong, Linpu He, Wei-Shi Zheng, Zhilin Zhao
任务设定 统一潜空间中渐进学习异构角色控制技能
痛点动机 多来源、多监督形式的技能难以共享复用
解决方案 共享运动解码器,用运动直觉蒸馏统一追踪与文本生成等任务
12

Think Only When Needed: Prompt-Authority Control for Selective Slow-Path Intervention in Vision-Language-Action Manipulation

Zhiruo Zhou, Zelin Li, Xiwen Chen, Jiazhuo Li, Chenwei Wang, Huiming Chen, Xiaojun Zhu
任务设定 检索增强 VLA 机械臂策略时的指令控制问题
痛点动机 追加文本改变指令形式即可致成功率骤降至 3%
解决方案 提出 TOWN-VLA 权限接口,仅兼容时才授权替换指令,否则保留原 prompt
13

EchoWM: Open and Enterable Omnimodal World Models

Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu, Yilang Sun, Shiyi Zhang, Haoran Li, Xiaoxiao Ma, Yuming Li, Yijun Liu, Yaofeng Su, Yanwen Ma, Haoyu Wu, Zihan Su, Yue Ma, Lvmin Zhang, Haoyang Huang, Zeyue Xue, Anyi Rao, Nan Duan
任务设定 构建可导航交互的全模态世界模型(视频+音频+语音)
痛点动机 现有世界模型难以统一多模态生成长时轨迹控制
解决方案 共享 6-DoF 轨迹统一一/三人称控制,渐进式+自回归训练支持长时生成
14

Pointing-VLA: Typed Spatial Grounding Interfaces for Vision-Language-Action Manipulation

Xiwen Chen, Zelin Li, Zhiruo Zhou, Huiming Chen, Chenwei Wang, Xiaojun Zhu
任务设定 为 VLA 机器人操作模型设计类型化空间定位接口
痛点动机 文本坐标或动作 token 表达空间信息导致接口脆弱、效率低
解决方案 类型化空间读出头替代文本坐标,作为 π0.5 策略引导显著提升操作成功率
15

From Generation to Simulation: How Far Are World Models from Being True Simulators?

Tong Wang, Huan Deng, Mucheng Yang, Yang He, Xiaohui Kuang, Gang Zhao
任务设定 系统评估世界模型能否替代传统仿真器
痛点动机 视频生成快速发展,但与真正仿真器的能力差距缺乏系统评估
解决方案 梳理 200 篇工作在 8 项仿真器能力上的表现,指出状态反馈是最大短板并给出改进方向
16

ParallelWorld: Test-Time Scaling for Embodied Reasoning

Min Chen, Shengjun Zhang, Yuxin Li, Zhang Zhang, Xin Fei, Chong Xia, Yueqi Duan
任务设定 具身智能体的主动探索与推理任务
痛点动机 现有方法单步短视探索,难应对遮挡环境的延迟反馈
解决方案 提出多步并行树搜索框架,并行模拟多条未来轨迹,用验证器动态剪枝选优
17

Motion-Based Tokenization for Cross-Dataset Egocentric Gaze Modeling

Virmarie Maquiling, Zhuojiang Cai, Enkelejda Kasneci
任务设定 第一人称视角注视点(gaze)的跨数据集建模
痛点动机 原始注视轨迹嘈杂,离散事件标签又丢失局部运动结构
解决方案 提出基于角位移的运动化注视点分词方法,兼顾可解释性与跨数据集迁移能力
18

Results of the 1st Asynchronous CASTLE Challenge at the Joint Egocentric Vision Workshop in Conjunction with CVPR 2026

Luca Rossetto, Werner Bailer, Cathal Gurrin, Graham Healy, Omar Shahbaz Khan, Stevan Rudinac, Klaus Schöffmann, Allie Tran
任务设定 CVPR 2026 第一人称视觉研讨会 CASTLE 挑战赛结果报告
痛点动机 缺少对异步第一人称视觉任务参赛方案的系统性总结
解决方案 汇总首届 Asynchronous CASTLE 挑战赛的参赛方法与评测结果
19

UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models

Lars Osterberg, Maggie Wang, Mac Schwager
任务设定 统一 VLA 模型的记忆与动作控制,处理长时序任务
痛点动机 现有记忆方案依赖额外 VLM,存在记忆瓶颈和训练割裂
解决方案 提出 UniMem 框架,用事件分类器和关键帧编码构建统一记忆机制,单一骨干网络同时处理记忆与控制
20

Triplet2Track: A Hierarchical System with Object-Centric Representations for Reliable Long-Horizon Manipulation

Jianxiang Liu, Gaojing Zhang, Chuan Wen, Qipeng Liu, Yuxuan Zhao, Ning Guo, Wenzhao Lian
任务设定 基于人类视频进行长时序机器人操作的模仿学习
痛点动机 端到端 VLA 模型不透明数据重,分层方法缺在线反馈易开环幻觉
解决方案 实例化三元组表示子目标并转为轨迹先验,在线监测进度实现闭环重规划
21

Multiple View Neural Regression of a Facial Shape Model

Xiang Li
任务设定 从多视角图像回归可动画化 3D 人脸网格
痛点动机 人工重拓扑人脸网格费时费力,难以规模化生产
解决方案 合成多视图数据训练神经网络,结合相机参数与 3D 关键点正则化直接回归标准化人脸网格
22

AI-based worker guidance in assembly and disassembly operations using multimodal ego/exo-centric data capture and structured task knowledge

Vivek Chavan, Jörg Krüger
任务设定 第一/第三人称视频提取装配拆卸任务知识
痛点动机 专家装配拆卸经验难记录、难复用、难迁移
解决方案 联合编码视频与语音解说,构建结构化任务表示,实现情境化工人指导
23

EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen
任务设定 第一人称视角预测未来双手运动
痛点动机 现有端到端方法忽略操作过程建模,梯度相互干扰
解决方案 两阶段框架:先学显式操作规划,再据此生成运动,避免相互干扰
24

Where World Models Break: Natural-Input Failure Discovery

Zhanpeng Shi, Zi Liang, Rong Feng, Shiqin Tang, Xuyang Chen, Hongzong Li
任务设定 评测世界模型在极端输入下的预测失效情况
痛点动机 现有评测只看平均误差,忽略罕见工况下的灾难性崩溃
解决方案 提出 BasinLens ,结合不确定性引导的全局搜索与局部类型化扰动挖掘失效案例
25

Robust Bimanual Vision-Language-Action Models via Embarrassingly Simple Modality Masking

Dongzhou Cheng, Ziang Li, Yixiao Zhou, Haojuan Li, Jinghao Zhang, Lei Lei, Minjing Dong, Jie Gui, Jiaqi Wang
任务设定 提升双臂机器人操作策略的鲁棒性
痛点动机 查询式 VLA 模型易受多视角与语言融合不稳定干扰
解决方案 提出模态掩码机制 M3 ,训练时随机遮蔽部分模态通道
26

WAM-OPD: On-Policy Distillation for World Action Models

Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang
任务设定 世界动作模型做在线策略蒸馏后训练
痛点动机 蒸馏后学生模型在分布外状态下能力退化
解决方案 学生自主生成轨迹,冻结教师模型标注视频与动作目标联合训练
27

Pre-Decoding Acoustic Triage for Budgeted Vision-Language Captioning of Untrimmed Egocentric Video

Masoud Jalayer, Changyi Li, Yu Xiao
任务设定 预算受限下对第一视角长视频做 VLM 字幕生成
痛点动机 逐窗口调用 VLM 代价高,现有筛选方法仍需先解码视频
解决方案 音频优先筛选窗口,检测器按动作而非逐帧触发
28

TransHands: Repurposing Human Pose Encoders as Hand Pose Encoders

Milo Piccioli, Gianluca Amprimo, Claudia Ferraris, Gabriella Olmo
任务设定 从 2D 单目输入估计 3D 手部姿态
痛点动机 3D 手部标注数据稀缺,远少于人体运动数据
解决方案 将预训练人体姿态编码器迁移到手部,加轻量适配模块对齐运动学
29

The Imitator Game: Benchmarking Robot Imitative Ability Beyond Action Prediction

Xunzhe Zhou, Yiyang Cai, Fengyi Wang, Ran Ju, Hanxiang Ren, Ruizhe Liu, Yu Zhang, Qian Luo, Feng Chen, Pei Zhou, Yi Ma, Yanchao Yang
任务设定 评测机器人从人类演示中意图级模仿的能力
痛点动机 现有策略只会复现轨迹,难以理解演示者的真实任务意图
解决方案 提出四级基准与配对数据集 IG-10K ,发现功能替代是意图模仿的关键瓶颈
30

TONAV: Task-Oriented Navigation and Action-Velocity Chunk Learning for Articulated Object Quadrupedal Mobile Manipulation

Haoran Lin, Mingyu Yang, Pengfei Qi, Kehan Chen, Qiang Diao, Liangji Zeng, Wenrui Chen, Yaonan Wang, Kailun Yang
任务设定 四足机器人对铰接物体的移动操作任务
痛点动机 导航与操作衔接不足,接触过程易抖动、不稳定
解决方案 提出任务导向导航结合动作-速度分块学习的统一框架,提升持续接触操作稳定性
31

BehaviorWorldGen: Closing the Loop between Action Models and World Simulators via Controllable Behavior-Aware Structured World Generation

Jiaqi Wang, Zhuo Zhang, Haining Guan, Tingguang Zhou, Haowen Cui, Zhongyang Zhu, Yulong Zheng, ChuanYe Wang, Xuefeng Chen, Zhen Yang, Tianchen Deng, Feiyang Tan, Hangning Zhou, Bo Dai, Lixia Shen, Xiwu Chen, Xiyang Wang, Jiajun Zhu
任务设定 构建世界模拟器与驾驶动作模型的自我提升闭环
痛点动机 现有模拟器生成的周围车辆行为不真实,数据分布失衡
解决方案 提出 BehaviorFlow 元动作条件轨迹生成模型,结合世界模拟器渲染真实交互场景
32

When Does Visual Generation Help Visual Understanding in Unified Multimodal Models?

Yubo Zhu, Zhehan Kan, Jingyi Yang, Miaolin Chen, Jinbo Xing, Kai Zhu, Zijian Wang, Sheng Zhong, Wei Tong
任务设定 统一多模态模型中视觉生成能否助力视觉理解的诊断评测
痛点动机 现有评测混淆任务难度与推理范式,结论不一致
解决方案 提出 VGAU-Diag 细粒度评测框架,发现瓶颈常在理解侧而非生成侧
33

Meta-Ctrl: Guaranteed Plan Generation by Decoupling Syntactic and Semantic Constraints

Gwen Yidou-Weng, Edward Sun, Tianyi Ma, Metin Alp Dogan, Benjie Wang, Allen Peng, Guy Van den Broeck, Yuchen Cui
任务设定 让 LLM 为机器人生成可执行且满足约束的计划
痛点动机 软方法无形式保证,符号规划器又丢失常识推理
解决方案 提出 Meta-Ctrl 约束解码框架,用元 token 分离语法与语义约束,兼顾正确性保证与计划质量
34

Inferring Action from Future Latent State for Robotic Manipulation

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Jie Cheng, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren
任务设定 机器人操作任务中预测动作而非生成视频帧
痛点动机 视频生成作为世界模型中间目标耗费算力且非必要
解决方案 提出 DELE-w0.5,从预测的未来潜在状态直接推断动作序列,跳过视频生成
35

ViSMoE: Visual-Aware Sparse Mixture-of-Experts for Embodied Referring Expression Grounding

Shuo Feng, Piji Li
任务设定 具身智能体依据语言指令导航并定位目标物体
痛点动机 现有方法混同视角与物体特征,导致视觉表征模糊
解决方案 提出 ViSMoE ,用视觉感知路由的稀疏专家分别编码视角与物体特征
36

WorldMind: Decoupled Game World Model for State-Aware NPC Behavior

Zhiyang Deng, Boran Zhang, Danze Chen, Yeying Jin
任务设定 游戏世界模型中实现状态感知的 NPC 行为生成
痛点动机 现有方法将 NPC 决策与视频生成纠缠,响应不够可控
解决方案 提出解耦四层架构(理解-决策-控制-生成),形成闭环交互驱动 NPC 行为
37

Operational digital twin clinics enable task-based evaluation of embodied AI

Xinyuan Wu, Jingrao Zhang, Mengdi Xu, Henry K. Chu, Mingguang He, Danli Shi
任务设定 把诊室照片转为可测试的数字孪生场景
痛点动机 真实临床环境搭建具身 AI 测试场景成本高难扩展
解决方案 重建带碰撞体、语义标注的仿真场景,支持多机器人闭环策略评估
38

Mamba-based Selective State Space Modeling Improves the Accuracy-Complexity Tradeoff of SmolVLA Vision-Language-Action Experts

Farida Mohsen, Thowayba Elkaffash, Mohammad Reza Chalak Qazani, Mohamed Mabrok, Nader Meskin, Ali Safa
任务设定 研究 VLA 模型动作专家的精度-效率权衡
痛点动机 长执行视野下 Transformer 动作专家成功率明显下降
解决方案 Mamba 选择性状态空间替代自注意力,长视野下性能提升 7.8%
39

Selective Cross-View Consistency for World Action Models: Held-Out Viewpoint Robustness Without Test-Time Camera Information

Bingqi Huang, Bingchuan Wei, Yingkai Cai, Zhaokui Wang
任务设定 提升世界动作模型对新视角的鲁棒性
痛点动机 视角变化是 WAM 最大扰动源,直接约束易损害动作预测
解决方案 提出 SCVC ,仅对视角不变的动作分量施加一致性约束,无需相机参数