Daily Paper Feed

2026 年 09 月 15 日 星期二 · 共 38 篇相关论文 · 全部存档
1

SlipSense: Multimodal Tactile Learning for Low-Latency and Generalized Slip Detection

Tong Jian, Aditya Thurvas Senthil Kumar, Xinyi Li, Ziling Chen, Tianyu Dai, Ali Sengul, Matteo Grimaldi, Wenjie Lu, Saleh Nabi, Tao Yu
任务设定 多模态触觉感知实现低延迟滑动检测
痛点动机 现有方案缺乏精确延迟量化和跨平台泛化能力
解决方案 融合压阻阵列与加速度计信号, 240 Hz 因果预测,实现零样本跨平台迁移
2

Learning Multimodal One-step Flow Policy via Value-weighted Optimal Transport

Jaehun Shon, Jinha Choi, Jongwook Jeon, Jongmin Lee
任务设定 离线强化学习中学习单步流策略
痛点动机 多模态动作分布下单步策略易模式坍塌或利用高估偏差
解决方案 最优传输耦合价值加权参考策略与单步策略,实现高效多模态蒸馏
3

When the World Lies: Backdoor Attacks on Latent World Models for Downstream Control

Roberto Riaño, Gorka Abad, Stjepan Picek, Aitor Urbieta
任务设定 研究预训练世界模型被植入后门以劫持下游控制器
痛点动机 世界模型被当作通用动力学骨干复用,供应链投毒风险易被忽视
解决方案 中毒模型将带触发观测导向特定潜在区域并重塑局部动态,使受害者自身的 Dreamer/MPC 优化过程自行学出攻击者目标动作
4

TopoRig: Topology-Agnostic Facial Rigging via Multi-Source Supervision

Andrew Fleet, Soroush Mehraban, Vida Adeli, Cole Clifford, Babak Taati
任务设定 拓扑无关的人脸自动绑定(facial rigging)方法
痛点动机 现有绑定依赖固定拓扑模板,跨拓扑迁移易产生几何伪影
解决方案 融合规范拓扑、跨拓扑迁移及图像线索等多源监督,直接在任意网格顶点预测 FACS 表情形变
5

Bench2Dex: Benchmarking Visuo-Tactile Bimanual Dexterous Manipulation Across Dexterous Hands

Zhenjie Yang, Yideng Zhang, Dongjie Zhang, Chenyu Jiang, Xianshuai Liu, Yufeng Li, Zuhao Ge, Xingyu Jiao, Zheng Zhang, Kaiyu He, He Wang, Yuwen Zhong, Yi Deng, Muyun Jiang, Xianliang Huang, Haisheng Su, Donghang Zhang, Jian Zhang, Xue Yang, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan
任务设定 评测 12 种灵巧手的双手视触觉操作基准
痛点动机 不同灵巧手结构、传感器布局差异大,难统一比较
解决方案 构建统一视触觉观测接口,含 26 个任务和 1300+ 次人类遥操作演示
6

V-ICAL Bench: Evaluating Video In-Context Learning for Multimodal Agents in Interactive Environments

Ziqian Fan, Shibo Xu, Junjie Li, Xiangyu Zhao, Shengyuan Ding, Yifan Yang, Zhenjie Yang, Haodong Duan, Yue Zhou, Zhihang Zhong, Xue Yang
任务设定 评测多模态智能体的视频上下文学习与交互策略能力
痛点动机 智能体难将视频演示转化为可执行策略并适应新环境
解决方案 提出 342 个任务的 V-ICAL 基准,测状态定位、规划与自适应能力
7

ESG: Generating Physically Consistent Dynamic 3D Scenes from Text Descriptions

Xintong Fang, Zhiyuan Fang, Rengan Xie, Xuhong Zhang, Guoyuan An, Zeran Liu, Jingyan Zhang, Jiarui Guo, Yuchi Huo
任务设定 从文本生成可执行的物理一致动态 3D 场景
痛点动机 动态场景生成需兼顾结构、时序与物理可行性
解决方案 用 LLM 构建演化场景图,经可微分仿真优化物理参数并输出可执行场景
8

Reconstructing Is Not Acting: Action-Centric Latent Dynamics Modeling

Dingjie Fu, Dianxing Shi, Yangyang Xu, Jun Yu
任务设定 从无标注视频中学习隐动作模型供机器人策略使用
痛点动机 发现重建误差低不代表隐动作学得好的错配问题
解决方案 提出 ACT-LAM ,用动作查询 IDM动作 token FDM 强化动作提取与利用
9

SparseTalk - Sparsifying 3D Gaussian Language Fields for Efficient 3D Visual Question Answering

Davit Soselia, Joseph JaJa, Amitabh Varshney
任务设定 面向 3D 场景问答的 3D 高斯语言场表征稀疏化
痛点动机 密集语义特征存储和推理开销巨大,冗余度未知
解决方案 提出物体级 token 稀疏化,仅用不到 1%的嵌入即保持问答性能
10

Legislating World-Model-Based Planning with Legal Reasoning

Dylan Waldner, Yiannis Kantaros, Guido Governatori, Risto Miikkulainen, Amir Banifatemi
任务设定 基于世界模型的机器人规划中加入法律约束
痛点动机 需让机器人行为执行前就合法合规,而非事后补救
解决方案 可废止道义逻辑约束运动规划器,世界模型同时提供规划与法律语境信息
11

LG-VLN: A Zero-Shot Vision-and-Language Navigation Framework with LangGraph State Orchestration

Jianhe Zhao, Yanhua Qiu, Zhiyu Zhang, Zibo Zhao, Jinhua Xie
任务设定 单目零样本视觉语言导航( VLN-CE )
痛点动机 现有方法依赖额外传感器,几何与语义表征易不一致
解决方案 在线 3D 重建网络预测深度与位姿,结合 LangGraph 状态编排实现语义导航
12

Tele360: Real-Time Feed-Forward Human Reconstruction from Sparse Unposed Cameras

Hanzhang Tu, Zhanfeng Liao, Wei Min, Jiajun Zhang, Yebin Liu
任务设定 稀疏无位姿相机流实时重建人体自由视角视频
痛点动机 现有方法依赖离线优化或标定相机,难以实时渲染高清画面
解决方案 多视角 Transformer 单次前向预测相机位姿与 3D 高斯,并蒸馏几何先验保持一致性
13

Steering Generative Robot Policies with Lexicographic Preferences

Yixuan Jia, Jonathan P. How
任务设定 预训练机器人策略在推理时遵循字典序偏好
痛点动机 部署时新增的优先级约束在训练阶段并未出现,难以兼顾
解决方案 动态屏障引导约束采样过程,并按优先级级联筛选候选轨迹
14

IMPACT-VLA: Interaction-aware Multimodal Propagation Attribution via Counterfactual Trajectories for Vision-Language-Action Policies

Jinwoong Kim, Sangjin Park
任务设定 分析 VLA 策略 各模态在不同执行阶段的贡献度
痛点动机 现有归因方法忽略阶段依赖性和跨阶段传播效应
解决方案 划分行为阶段为归因单元,用反事实闭环重执行量化各模态贡献
15

PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models

DeepCybo Team, Yu Bin, Haipeng Cao, Zheng Chang, Kai Chen, Youning Chen, Kailin Deng, Yichao Du, Xiaotong Fu, Haoyang Ge, Yunlong Guo, Chenliu Hao, Jiyan He, Xuguo He, Yakun Hou, Kai Hu, Cong Huang, Tuopusen Huang, Yu Huang, Hong Li, Peize Li, Shijie Lian, Xiaopeng Lin, Yun Lin, Haibao Liu, Haochen Liu, Qiuzhi Liu, Shengcai Liu, Zhiqiang Liu, Tao Luo, Peng Ren, Shuo Ren, Chaoyi Ruan, Zhaolong Shen, Yukun Shi, Qiyuan Su, Yuxuan Tian, Yining Wang, Changti Wu, Hao Wu, Xueyin Xu, Ruoqi Yang, Zhaoyang Yang, Hang Yuan, Zhaoyang Zeng, Hanwen Zhang, Ruimeng Zhang, Yao Zhang, Yibo Zhang, Yuxiang Zhang, Zhirui Zhang, Ziyi Zhang, Zubin Zheng, Zishen Zhuang et al. (24 additional authors not shown)
任务设定 统一具身环境理解、动作生成与未来预测
痛点动机 视觉语言模型难以直接产出物理动作与场景变化
解决方案 将末端执行器运动、视觉目标离散化为序列,用自回归方式与语言联合训练,仅用人类交互视频做具身预训练
16

MoVT: Video-Augmented Motion Tokenizer for Text-to-Motion Generation

Beibei Jing, Tianle Guo, Youjia Zhang, Zikai Song, Yawei Luo, Junqing Yu, Tao Guan, Wei Yang
任务设定 文本驱动 3D 人体动作生成
痛点动机 3D 动作数据稀缺,难以覆盖多样文本描述
解决方案 构建跨模态动作分词器,把 3D 动作 token 投影到 2D 视频域,借助动作视频扩充动作码本
17

One Model, Two Physical Stories: Auditing Misalignment in Multi-Modal World Modeling

Geigh Zollicoffer, Minh Vu, Rajiv Ranasinghe, Manish Bhattarai
任务设定 审计多模态世界模型视频与文本预测的一致性
痛点动机 同一模型不同模态输出可能互相矛盾,且偏离真实物理
解决方案 构建物理约束对比流程,量化事件、幅度、时序等维度的内外部不一致
18

Skill Composition for Legged Robot Reinforcement Learning

Daniel Gigliotti, Flavio Maiorana, Fabio Patrizi, Luca Iocchi
任务设定 研究腿式机器人多技能间的平滑切换与组合
痛点动机 独立训练的技能各自可靠,但切换衔接处容易失效
解决方案 把技能组合当作独立课题,用可验证的策略切换机制连接子策略,使上层规划器可安全调度
19

Diffusion-Based Generation of Gait Trajectories

Damian Benasco, Juan Carballeira-Lopez, Jaime Ramos-Rojas, Julio S. Lora-Millan, Antonio J. Del-Ama, David Rodriguez-Cianca, Pablo Lanillos
任务设定 生成用于外骨骼和康复的下肢步态轨迹
痛点动机 传统步态模板难以适应个体差异和不同行走条件
解决方案 条件扩散模型(含自适应归一化、无分类器引导)生成可控且符合生物力学的关节角轨迹
20

Open-UniMo: Towards Unified Motion-Language Understanding and Generation in the Open World

Guocun Wang, Kenkun Liu, Guorui Song, Jing Lin, Zhe Huang, Luyuan Zhang, Dake Zhong, Choo Sin Wai, Xiaoguang Han, Haoqian Wang
任务设定 统一开放世界运动语言理解与生成任务
痛点动机 动作常被当作语言附属模态,跨模态交互不足且自回归易累积误差
解决方案 扩展词表加入运动 token 形成统一 token 空间,并用 CoT 推理连接语言与动作生成
21

PuzzleMate: Benchmarking MLLMs for Egocentric Puzzle Assistance

Avijit Dasgupta, Shayon Dasgupta, Zakaria Laskar, C. V. Jawahar, Karteek Alahari
任务设定 评测 MLLM 在第一人称视角拼图引导任务中的表现
痛点动机 拼图需要精细空间推理,现有 MLLM 能力尚未验证
解决方案 提出 PuzzleMate 框架与基准,通过人机协同评估分步指导能力
22

AlayaVista: Streaming World Modeling from Panoramic States to Perspective Video

Jiaming Tan, Mingliang Zhai, Zhen Li, Yuwei Wu, Chuanhao Li, Kaipeng Zhang
任务设定 研究相机可控的流式视频世界模型生成
痛点动机 局部视角需记忆离屏内容,全局表征又难以流式渲染
解决方案 解耦全景状态演化与透视视频合成,蒸馏为少步流式生成
23

Task-Specified Active Metrological Inspection with Measurement-Steered VLA Manipulation and Deterministic Evidence Gating

Zhiling Chen, Jingzhan Ge, Ruimin Chen, Matthew P. Castanier, David Gorsich, Farhad Imani
任务设定 双臂机器人执行任务指定的计量检测
痛点动机 通用 VLA 智能体难保证测量证据完整可信
解决方案 结合 VLA 操作与激光测量,用确定性证据门控保证结果可追溯
24

MorphoStyle: Motion Style Transfer with Morphology Control

Xin Feng, Eleonora D'Arnese, Mohan Sridharan
任务设定 面向非标准体型的运动风格迁移
痛点动机 现有方法风格迁移与体型适配难兼顾,易泄露内容
解决方案 形状条件 FSQ-VAE 解耦风格、内容与体型,生成风格化运动
25

SignMimic: Robust High-Quality Sign Language Motion Generation via Human-Shape-Oblivious Pose Transfer Guidance

Zhewen He, Junyi Yu, Haomian Huang, Zhenhua Li, Yi Fang
任务设定 给定驱动视频和参考帧生成手语模仿视频
痛点动机 现有方法易导致手形漂移和时空不稳定
解决方案 刚体规范化分离运动,结合姿态迁移与扩散模型生成视频
26

Talking to Me or Someone Else? Rethinking Talk-to-Me Detection in Egocentric Videos

Feiyu Du, Xi He, Jia Li, Yapeng Tian, Weili Wu
任务设定 自我中心视频中在线判断谁在对摄像佩戴者说话
痛点动机 离线整段分类脱离实际交互,且忽略多样的非 TTM 说话状态
解决方案 构建逐帧标注新数据集,用融合音频、视觉与语音语义的多模态模型做在线判断
27

LPA-CWM: A Learned Physical Adjudicator for Motion Reasoning with Counterfactual World Models

Kunwei Wu, Xiang Liu, Guocai Yao, Junming Chen, Zhikang Chen, Min Zhang, Pengwei Wang, Sen Cui
任务设定 反事实世界模型的预测差异中提取物体运动信息
痛点动机 不同目标帧掩码生成的响应可靠性不一,均匀加权聚合效果差
解决方案 训练轻量可学习物理裁判器给候选响应打分加权,再定位修正运动
28

What Makes an Efficient VLA? Navigating Action-Head Design, Scaling, and Latency

Luoyang Sun, Guoyang Xia, Fengfa Li, Lei Ren, Xinyu Cui, Haifeng Zhang, Fangxiang Feng, Kaike Zhang, Kun Zhan, Yan Xie, Jun Wang, Cheng Deng
任务设定 系统研究 VLA 模型中动作头设计、规模与延迟的权衡
痛点动机 各模块对性能的真实贡献不明确,此前缺乏延迟对齐的对比实验
解决方案 发现动作头初始化方式(复制语言层权重)是决定性能的关键,比解码器架构更重要
29

ReWeight: Leveraging Human Data for VLA Post-Training via Demonstration Retrieval and Sample Weighting

Chenwei Wang, Dianye Huang, Match W. L. Ko, Chenjia Bai, Zhongliang Jiang
任务设定 用人类第一视角数据做 VLA 机器人后训练
痛点动机 人机数据混合易因跨具身差异降低策略性能
解决方案 跨具身视觉运动表征检索相似人类演示,再按相似度做样本加权融合
30

LePlanner: An Iterative Amortized Controller For World Models

Saksham Bansal, Om Naphade, Chayan Aggarwal, Vrishin M
任务设定 世界模型潜空间中高效规划动作序列
痛点动机 搜索式规划计算量大,摊销策略在接触密集任务上易失效
解决方案 提出摊销迭代控制器,用到达并保持目标训练,减少规划所需预测次数与延迟
31

DiVA: Enabling Interactive Digital Life Simulation via Video Models

Cheng Chen, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Wen Wang, Yihao Meng, Hanlin Wang, Yixuan Li, Jiacheng Wei, Zhenshan Tan, Yanhong Zeng, Yujun Shen, Guosheng Lin, Fayao Liu
任务设定 基于视频模型的交互式数字人长时模拟
痛点动机 长时多轮视频生成易画质退化、动作不连贯
解决方案 用 MLLM 做路由,配合锚定视频续接模块保证过渡稳定,支持复杂姿态变化
32

GEAR: From Dynamic Encoding to Dynamic Activation in Social Trajectory Prediction

Jiaheng Chen, Jiaxing Li, Leixia Wang, Jianan Ju, Tinghe Zhang
任务设定 人群轨迹预测中社交线索的激活时机问题
痛点动机 现有方法只关注社交信息编码,忽视其生成时该何时起作用
解决方案 提出生成感知偏置激活模型,按证据强弱动态调节社交与个体偏置的参与度
33

Compositional Shift Algebra: Extrapolating Mixed Robot Shifts Without Mixed Finetuning

Jinting Hang, Zhenhui Cai
任务设定 机器人部署中相机、动作接口、动力学多重偏移同时适应
痛点动机 传统方法需为每种偏移组合单独微调,成本高昂
解决方案 分别学习单因素偏移算子,用算子组合外推到混合偏移,无需混合微调
34

RIGOR: Rig-Informed Geometry for Omnidirectional Reconstruction

Tingjun Huang, Dmitry Rudshin, Mathieu Meyer, Pietro Bonazzi, Marc Pollefeys, Emilia Szymańska
任务设定 全景视频重建场景并估计相机轨迹
痛点动机 长轨迹在重复纹理、弱纹理场景中易累积漂移
解决方案 将全景图视为四视角虚拟相机组,检测修复不一致预测,通过闭环检测和位姿图优化校正漂移
35

Attention-DP3: Spatially Object-aware 3D Diffusion Policy via Geometry-aligned Attentional Conditioning

Changbo Yan, Zhongbo Zhang, Zaibin Zhang, Yifan Wang, Lijun Wang, Huchuan Lu
任务设定 杂乱遮挡场景下机器人的 3D 扩散策略 操作
痛点动机 目标物体被遮挡或与相似干扰物混杂时难以定位
解决方案 用开放词汇分割生成物体级 3D 先验,通过三重场注意力条件化增强 DP3 扩散骨干
36

Variational Template Matching with Statistical Fusion for Anomaly Detection in Patterned Structures

Qinwu Xu, Yifan Jiang
任务设定 诊断 VLM 在机械臂操作提示中的可供性定位失败
痛点动机 直接给出部件名称掩盖了视觉定位与机械推理的真实能力
解决方案 反事实测试及信息拆分,分离视觉定位、机械推理与类别关联能力
37

Reliable Egocentric Action Anticipation via Temporal Reliability Suppression and Compositional Graph Decoding

Mahsa Mohammadi, Sareh Rowlands
任务设定 带噪声干扰下的第一视角动作预测鲁棒性
痛点动机 现有方法假设观测干净,缺帧掩码等干扰会导致预测失效
解决方案 时序可靠性抑制加权编码,结合动词-名词图解码修正不合理组合
38

Sampling headroom is not selection gain: a compute-value audit of test-time scaling for video world models

Yuhua Jiang, Junjie Lu, Feifei Gao
任务设定 审计视频世界模型测试时扩展的采样收益转化
痛点动机 采样候选变多,但验证器未必能可靠选出更优结果
解决方案 提出 Compute-Value Audit 框架,发现自适应选择策略常不敌均匀采样