Daily Paper Feed

2026 年 08 月 17 日 星期一 · 共 11 篇相关论文 · 全部存档
1

Marionette: Predicting World States, Rendering Geometry, Painting Appearance

Zian Meng, Zhen Li, Chuanhao Li, Qiang Li, Kaipeng Zhang
任务设定 游戏中关节角色的交互式世界建模与渲染
痛点动机 隐空间自回归易导致姿态几何长期漂移、一致性差
解决方案 显式预测 3D 世界状态(骨骼姿态轨迹),经零参数渲染器转控制信号,再用视频扩散合成画面
2

Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation

Yuxuan Chen, Wanruo Zhang, Xiao Li
任务设定 针对动态反应式操作任务评测 VLA 模型能力
痛点动机 现有基准仅评估静态操作,忽略动态交互场景
解决方案 提出 ReflexBench 基准和 ReflexVLA 模型,用潜在未来预测与多帧时序融合加速响应
3

PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment

Yuyang Liu, Yanqing Shen, Ruike Chen, Jifan Zhao, Yuxuan Tian, Yichi Zhang, Tianfeng Long, Zixuan Yin, Yipu Wang, Ziheng Qin, Wenxing Tan, Yang Shi, Mingyu Cao, Runze Xiao, Ziqi Wang, Zhixin Yin, Shiwei Chu, Yi-Fan Zhang, Yao Mu, Yuheng Ji, Yihao Wang, Jun Yan, Zhongyuan Wang, Pengwei Wang, Xiaolong Zheng
任务设定 机器人操作过程进行细粒度评估
痛点动机 现有评估只看成功率,忽略执行过程质量
解决方案 rollout 视频转为进度曲线,提出多个过程级细粒度指标
4

Zero-Shot Skeleton-Based Action Anticipation

Hongsong Wang, Pengbo Yan, Yang Zhang, Qiuxia Lai
任务设定 基于早期骨骼序列预判未见动作类别
痛点动机 传统骨骼动作预判假设类别全见,难泛化新动作
解决方案 提出互信息最大化模块,对齐局部骨骼特征与语义嵌入实现零样本预判
5

SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation

Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo
任务设定 统一 3D 重建、稠密对应与空间推理任务
痛点动机 各任务独立建模,限制了跨任务知识迁移
解决方案 提出统一多模态生成框架,将各任务转为指令条件生成,联合建模稀疏与稠密输出
6

Traj-LeWM: Path-Aware World-Model Planning via Latent Trajectory Cost

Xiaodi Huang, Ziyi Ding, Jingtian Wan, Yuchen Liu, Yuan Zhang, Xiao-Ping Zhang, Jiayu Chen, Zhang Zhang, Tao Huang
任务设定 视觉世界模型中候选动作序列的排序与规划
痛点动机 仅靠终点距离评分,忽略轨迹中间过程信息
解决方案 提出隐空间轨迹代价 (LTC),结合终点距离联合用于训练与规划打分
7

Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

Yi Ding, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang
任务设定 为 VLA 机器人模型引入工具调用能力
痛点动机 端到端动作空间复杂,泛化差且依赖大量数据
解决方案 提出 ART 框架,让 VLA 调用视觉、可供性等外部工具模块,降低动作空间复杂度并提升泛化与数据效率
8

AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning

Zhiyue Zhao, Jingyi Wu, Hairuo Liu, Mingyu Liu, Liyang Li, Hengdi Zhang, Tong He, Zhengxue Cheng
任务设定 从人类演示中学习灵巧操作策略
痛点动机 机器人演示数据昂贵,跨本体动作空间不一致
解决方案 提出 AdvDex 框架,用关节对齐动作空间统一人手与机械手,并用对抗学习消除本体外观差异实现跨本体泛化
9

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam
任务设定 动作条件视频世界模型的少步交互式生成
痛点动机 因果蒸馏难兼顾低延迟生成与键鼠动作对齐
解决方案 提出 ForgeWM ,通过渐进式因果训练与蒸馏,将双向生成器转为 1-4 步的少步世界模型
10

OpenBelief-Nav: Evidence-Preserving Object Memory for Open-Vocabulary Language-Guided Navigation

Dinh Tuan Nguyen, Anh Dao, Phuong Nam Dang, Quan-Dung Pham, Tuyen P. Le, Truong Nguyen, Quan Nguyen
任务设定 开放词汇语言引导导航中的物体记忆构建
痛点动机 场景图过早融合特征/标签,易丢弃少数关键线索
解决方案 提出证据保留物体记忆,保留观测级短语与可靠性线索,任务时按需读出定位目标
11

Active Perception for Embodied Disambiguation

Yiwei Liu, Luwei Yang
任务设定 具身智能体在语言指令下的目标消歧任务
痛点动机 遮挡、视角受限等物理因素也会造成目标歧义,仅靠提问不够
解决方案 提出主动感知框架,用 VLM 决策观察/澄清/选择目标,真实机器人验证