Daily Paper Feed

2026 年 09 月 10 日 星期四 · 共 17 篇相关论文 · 全部存档
1

Programmable World Model

Zheng-Hui Huang, Guixu Lin, Jiacheng Lin, Yi-Chuan Huang, Ruihan Yu, Muyao Niu, Siqi Yang, Yu-Lun Liu, Yung-Yu Chuang, Kaipeng Zhang, Zhixiang Wang
任务设定 视频世界模型维持可编程的持久世界状态
痛点动机 现有世界模型缺乏规则控制与持久状态维护
解决方案 把指令转为程序控制实体状态,用 3D 包围盒驱动预训练视频模型渲染
2

Show-Harness: Just a VLM Agent Can Play Robots

Yanzhe Chen, Zechen Bai, Zhijun Cao, Wenzheng Zeng, Kevin Qinghong Lin, Yiqi Lin, Guoqiang Liang, Kevin Yuchen Ma, Qiming Huang, Mike Zheng Shou
任务设定 VLM 通过语义接口直接控制机器人
痛点动机 VLM 的通用智能难以转化为具体机器人动作
解决方案 设计离散语义动作单元连接意图与动作,配合具身解释器落地执行
3

DUET-DINO: Simultaneous Cross-View World Modeling for Latent Planning in Robot Manipulation

Nisarga Nilavadi, Ralf Römer, Moritz Reuss, Michael Krawez, Tobias Jülg, Angela P. Schoellig, Rudolf Lioutikov, Wolfram Burgard
任务设定 面向机器人操作的双视角潜在世界模型规划
痛点动机 单视角世界模型难支持精细 7 自由度末端控制
解决方案 跨视角条件联合建模侧视与腕部相机,实现潜在空间规划
4

Field Converter: Geometry-Initialized Temporal Residual Refinement for World-Grounded Player Pose Estimation from Soccer Broadcasts

Simon Khan, Laurent Gajny, Jennyfer Lecompte, Sébastien Laporte
任务设定 从足球转播视频估计世界坐标系下 3D 球员姿态
痛点动机 单目视频难将球员定位到统一度量世界坐标
解决方案 几何初始化确定根节点位置,再用时序残差网络修正
5

Semigroup-JEPA: Latent Dynamics Consistency for Zero-Shot Physics Generalization

Andy Zeyi Liu, Haoran Sun, Lucas Baker, Randall Balestriero, John Sous
任务设定 评估 JEPA 世界模型对物理动力学的零样本泛化
痛点动机 JEPA 世界模型能否真正学到物理规律尚未验证
解决方案 通过动作条件化注入物理参数,训练自回归潜在编码预测器
6

Decoupled Self-Forcing Distillation for Streaming Talking Head Generation

Yanru An, Ruiyan Wang, Wenwu Wei, Rui Bu, Qi Wang, Hongwei Hu, Zhengxue Cheng, Rong Xie, Li Song, Wenjun Zhang
任务设定 音频驱动的流式说话人头视频生成
痛点动机 端到端方法保真但慢,两阶段方法快但保真度
解决方案 解耦运动空间融合音频条件,用自迫真蒸馏训练因果流式模型
7

3rd Place Solution to Human Motion Challenges in Real-World and Clinical Settings (MoCha) @ECCV2026: Language-Aligned Motion Representations for Domain-Generalizable UPDRS-Gait Severity Estimation

Soojie Kim, Muhammad Munsif, Minkyung Kim, Seungryul Baek
任务设定 基于 SMPL 运动序列的跨域 UPDRS 步态严重度分级
痛点动机 多临床站点数据异质、类别不平衡,跨域泛化困难
解决方案 语言对齐的 Bi-GRU 学运动表征,各域微调后参数融合为统一模型
8

Time-Frequency Geometric Cross-Attention for Chunked Vision-Language-Action Models

Shengye Dong, Haochen Niu, Hao Liu, Peiwen Lin, Chuang Wang, Shanmin Pang
任务设定 改进 VLA 模型中动作块(chunk)的解码方式
痛点动机 动作块含多频率成分和跨阶段近正交几何关系,普通 token 难捕捉
解决方案 提出 TFGCA 模块:小波分解出时频 token,结合点积与楔积做跨注意力融合
9

Freezing of Gait Prediction Under Spatial Occlusion: An IMU-Supervised Cross-Modal Distillation Approach

Chandan Biswas, Aryan Singh, Anabik Pal
任务设定 结合 IMU 与视频预测帕金森步态冻结
痛点动机 转身时肢体遮挡使姿态估计失准, IMU 又难长期佩戴
解决方案 跨模态蒸馏将 IMU 运动先验迁移给视频模型,融合骨架图与像素特征
10

Recovering Biomechanical Signals from Missing Keypoints Using Temporal Interpolation in Monocular Gait Analysis

Shubham Jariwala
任务设定 单目步态分析中缺失关键点的膝关节角度恢复
痛点动机 遮挡等原因致踝关节缺失,破坏步态信号
解决方案 用简单一阶时序插值恢复缺失关键点,无需学习模型
11

Compact Visuotactile World Models for Lifting: Prediction, Reward Alignment, and Force Constraints

Qinzhen Ma, Sida Peng
任务设定 机器人抓取提升任务中的接触力预测与控制
痛点动机 触觉预测需转化为有效决策才具实际价值
解决方案 用轻量视触觉世界模型结合力约束在想象中训练策略
12

MotionBlind: Probing the Illusion of Motion Understanding in Video-LLMs

Dhairya Bhatia, Bishoy Galoaa, Oliver Fritsche, Shahid Kamal, Muhammad Obaidullah Abdul Salam, Umer Saleem, Om Rastogi, Frania Felix Chettiar, Nesli Erdogmus, Sarah Ostadabbas
任务设定 评测视频 LLM 能否理解运动速度与方向
痛点动机 视频 LLM 常被当作世界模型感知前端,但实际读不懂运动
解决方案 提出 MotionBlind 对比基准,用近乎相同视频对逼模型利用真实时序信息
13

Valerant: An Automatic Navigable Game Map Generator via Action-Conditioned World Model Exploration

Yiran Qiao, Feng Wang, Jing Ma
任务设定 免训练地将动作条件世界模型转为 3D 游戏地图生成器
痛点动机 游戏无真实 3D 空间,动作视频 rollout 缺持久几何信息
解决方案 结合视频 rollout 预测与 SLAM 空间重建,探索式选动作逐步搭建 3D 地图
14

OmniPoint: Universal Monocular Metric Pointcloud from Any Camera

Botao Ye, Marc Pollefeys, Ming-Hsuan Yang, Abhijit Kundu
任务设定 统一针孔、鱼眼、全景等相机的单目度量点云重建
痛点动机 现有方法受限于固定相机模型,难以跨传感器泛化
解决方案 光线-距离解耦表示分离相机投影与场景结构,配合双向数据增广训练
15

No Free Checker: A Survey of Verifiers for Robot Policies

Yang Wan, Xihang Yue, Zhirui Liu, Ziyuan Chu, Shuxun Wang, Yuhan Chen, Xiaonan Jiang, Xukun Zhu, Yubo Dong, Linchao Zhu
任务设定 综述机器人策略的验证器方法
痛点动机 验证器可用性越高,可信度往往越低
解决方案 按人类/规则/学习/模型内在四类梳理 150 种验证器,提出九项可检验指标
16

Geometry Conditioning in an Embodied SLM: Training Controls and Robustness Diagnostics in a 0.8B Hybrid Model

Hao Li, Haofei Sun, Lin He
任务设定 评估几何输入对 0.8B 具身模型操作策略的影响
痛点动机 尚不清楚坐标对齐训练能否带来真实物理泛化
解决方案 对比多种几何条件方案,发现训练时几何对齐无稳定优势,视觉策略对物体位移仍很脆弱
17

Identifying Habit, Physics, and Nuisance in Robot World Models

Jinting Hang, Zhenhui Cai
任务设定 解耦机器人世界模型中的习惯、物理与观测噪声
痛点动机 示教数据的多模态性会让预测器混淆三种不同成因
解决方案 结构因果模型分解动作与状态,冻结共享物理模块只更新轻量接口,提升小样本迁移