Daily Paper Feed

2026 年 08 月 24 日 星期一 · 共 17 篇相关论文 · 全部存档
1

VT-MUSE: Multimodal Unified Sequential Visuotactile Representation Learning for Manipulation

Congsheng Xu, Qiaochu Yang, Fangyuan Shi, Yifan Han, Baijun Chen, Yiming Wang, Haonan Zhao, Daolin Ma, Xiaokang Yang, Hesheng Wang
任务设定 面向机器人操作的视触觉统一序列表征学习
痛点动机 视觉触觉独立编码,难以捕捉细粒度跨模态依赖与接触时序演化
解决方案 两阶段框架:先跨模态时序对齐预训练,再用条件变分模型融合掩码视觉与触觉历史,接入轻量策略网络
2

Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

Zhuoyuan Li, Rui Zhao, Jin Wang, Hanwei Zhu, Cong Zhang, Giuseppe Valenzise, Weisi Lin, Kin-Man Lam
任务设定 面向 VLA 模型推理加速的视觉 token 压缩策略
痛点动机 现有压缩仅按视觉冗余度量,忽略对下游动作预测的实际影响
解决方案 提出 Action-JND 指标,用轻量估计器预测 token 扰动的可容忍动作偏差,据此指导压缩
3

Human-JEPA: A Human-Centric Vision Model that Perceives and Anticipates

Hui Wei, Licai Sun, Guoying Zhao
任务设定 视频中人体姿态感知与未来动作预测建模
痛点动机 现有人体视觉模型只做静态感知,无法理解运动与预测未来
解决方案 提出 Human-JEPA ,用锚定预测训练防止特征坍塌,以过去-未来划分替代块掩码学习动作预测
4

Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding

Jie Xu, Na Zhao
任务设定 流式 RGB-D 输入下的开放词汇 3D 场景理解与分割
痛点动机 现有方法难处理流式数据且对 2D 分割噪声敏感
解决方案 局部-历史嵌套架构结合几何-语义融合机制,配合流形距离优化实现鲁棒实时分割
5

Gaussian-Mixture Latent Flow for Stochastic 3D Human Motion Prediction

Yue Ma, Frederick W. B. Li, Xiaohui Liang
任务设定 随机人体运动预测,预测未来动作的分布
痛点动机 现有方法忽视运动合理性不确定性量化
解决方案 提出高斯混合隐流模型,用数据驱动先验解耦多样行为并支持似然计算
6

WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving

Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang
任务设定 自动驾驶中的世界-动作模型规划任务
痛点动机 V-JEPA 的随机掩码与确定性回归难以匹配动作驱动的未来预测
解决方案 改用未来掩码预训练与条件流匹配预测潜在未来,联合去噪场景与轨迹
7

Graph-Operator World Models for Morphology-Parameter Generalization in Continuous Control

Xu Yang, Yiqin Yang, Qianchuan Zhao
任务设定 机器人形态参数泛化的连续控制世界模型
痛点动机 已有世界模型换质量、杆长等形态参数后性能会下降
解决方案 图结构建模 body 与运动学关系,将状态转移拆成形态无关基底加形态相关算子
8

SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers

Sakif Hossain, Julian Teusch, Jörg P. Müller
任务设定 人体运动预测任务,需给出校准且结构化的不确定性估计
痛点动机 贝叶斯/集成法要多次采样,保形预测又缺认知不确定性信号
解决方案 提出保形贝叶斯末层,单次前向得到解析的时域不确定性尺度,结合保形校准输出有效预测区间
9

CertVLA: Certified Defense against Physical Visual Attacks for Vision-Language-Action Models

Hui Lu, Zhijie Peng, Yuqi Lin, Zaijia Yang, Jiaming He, Shuhan Ye, Yi Yu, Hanwei Zhu, Bingquan Shen, Alex Kot, Xudong Jiang
任务设定 为 VLA 机器人策略的物理块状/纹理攻击提供可认证防御
痛点动机 现有认证防御仅适用离散标签,难保障连续动作的可靠性
解决方案 确定性覆盖掩码校准动作一致性,为闭环动作序列提供有限样本认证保证
10

DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion

Jiakun Li, Li Fang, Hao Zhu, Fei Hu, Long Ye, Yuan Zhang, Jinyao Yan
任务设定 单图重建可动画的 3D 人体化身
痛点动机 扩散模型依赖多视角生成,计算开销大且易视角不一致
解决方案 改用 UV 空间扩散做隐空间补全,教师-学生框架保 3D 一致,解码为 3D 高斯
11

ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation

Siyuan Ma, Yutian Zhang, Boshi Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Xiaojin Huang
任务设定 传送带移动物体抓取的 VLA 策略学习
痛点动机 VLA 策略仅凭当前观测,难以预判接触时机
解决方案 世界动作模型教师蒸馏未来 token ,推理时保持因果、无需显式想象未来帧
12

AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning

Junqi Wu, Kaihua Tang, Xuanwen Chen, Hongzhi Li, Jianqiang Huang, Xian-Sheng Hua
任务设定 基于单目 RGB 图像的开放世界 3D 功能区域定位
痛点动机 现有方法依赖预建 3D 几何和封闭本体,难以直接从 RGB 部署
解决方案 视觉语言模型引导解码器结合伪标签自训练,提升开放世界泛化能力
13

Identity-Aware Human-Object Interaction Motion Captioning

Yiming Wang, Yonghao Dang, Huilai Li, Jiawei Tu, Jianqin Yin
任务设定 生成带主体身份信息的人物-物体交互动作描述
痛点动机 现有 HOI 动作描述仅用「一个人」等泛称,缺乏身份关联
解决方案 多视角身份-动作学习模块结合两阶段描述重写,实现单视角身份感知描述生成
14

MV2GF: Multi-view Pedestrian Detection with a Visual Geometric Foundation Model

Taiga Yamane, Satoshi Suzuki, Ryo Masumura, Shota Orihashi, Tomohiro Tanaka, Mana Ihori, Naoki Makishima
任务设定 多视角图像检测行人生成鸟瞰图
痛点动机 现有方法对未见过的相机配置泛化能力差
解决方案 融合视觉几何基础模型的通用几何特征,用其预测的 3D 点图投影像素,避免依赖训练时的畸变模式
15

Aggregate, Don't Adapt: Subject-Level Posterior Aggregation and Transductive Calibration for Cross-Site Parkinsonian Gait Severity

Junlong Shen
任务设定 从跨站点 SMPL 步态数据预测帕金森病严重程度
痛点动机 临床站点间存在域偏移,模型难以跨站点泛化
解决方案 冻结预训练运动编码器,用受试者级后验聚合无标签直推校准大幅提升跨站点评分准确率
16

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello
任务设定 由单个第三人称视角视频生成第一人称视角视频
痛点动机 视角剧变导致大量不可见区域,几何条件难以可靠工作
解决方案 双分支视频扩散模型结合几何锚定与语义 grounding 分支,并用相机重定位算法修正误差
17

RISE: Adaptive Imagination for World Action Models

Hongbo Lu, Liang Yao, Chenghao He, Hao Han, Fan Liu, Wenlong Liao, Tao He, Pai Peng
任务设定 自动驾驶规划中 世界动作模型 的想象力预算分配
痛点动机 现有方法给每个场景固定想象预算,计算浪费或不足
解决方案 提出 RISE 框架,用 Latent Evaluator 估计风险收益,配合 Roll/Stop 门控 动态决定是否继续想象展开