Daily Paper Feed

2026 年 08 月 05 日 星期三 · 共 22 篇相关论文 · 全部存档
1

LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation

Tianbao Zhang, Zeyu Liu, Shuyu Wu, Fanxing Li, Zhaoxin Fan, Wenjun Wu, Danping Zou
任务设定 轻量级多视图深度估计,服务机器人 3D 感知
痛点动机 纯几何匹配在无纹理区域易失效,单目先验缺多视图约束
解决方案 MoE 融合单目语义先验到代价体,并蒸馏视觉基础模型知识
2

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu
任务设定 零样本 3D 视觉定位,依文本描述在点云中定位物体
痛点动机 查询文本存在歧义,且视角缺失导致定位困难
解决方案 LLM 消歧查询并构建 3D 场景图,推理最优视角辅助定位
3

LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation

Fan Yang, Yuting Su, Xiaobo Wang, Yuncheng You, Fugui Fan, Yuting Wu, Minghui Wu, Chenxu Zhao, JiaHong Ning, Peiguang Jing
任务设定 机器人操作中的世界-动作建模,预测场景演化并生成动作
痛点动机 现有世界-动作模型计算开销大,训练成本高
解决方案 紧凑潜空间联合建模未来状态预测与动作生成,单卡 24GB GPU 即可端到端训练,并用视觉转移令牌做无语言任务表示
4

PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud

Chenghua Wang, Daliang Xu, Dongqi Cai, Duojin Sun, Hao Zhang, Haoze Qian, Huaiyuan Zhang, Jinshuo Cui, Kezhao Zhao, Longxi Gao, Mengwei Xu, Rongjie Yi, Tianyue Zhang, Weikai Xie, Xiyuan Tan, Xuanzhe Liu, Yingying Qin, Yiwen Lu, Yuan Yao, Yuezhi Zu, Yunhan Guo, Ziqi Guo
任务设定 统一服务 VLA世界动作模型的推理引擎
痛点动机 云端强化学习、边缘、机载部署各用独立推理程序,难复用
解决方案 统一运行时+模型适配器分离架构逻辑,共享图执行与内核实现 1.4-4.65 倍加速
5

Learning Biomechanically Plausible Human Motion from Sparse Radar Point Clouds

Jonas Leo Mueller, Markus Gambietz, Alexander Weiss, Daniel Krauss, Bjoern M. Eskofier
任务设定 稀疏雷达点云估计生物力学人体运动
痛点动机 现有雷达姿态估计仅用无约束关键点,忽略解剖合理性
解决方案 融入全身骨骼模型,通过可微正向运动学端到端监督姿态网络
6

Geospatial-Prior Guidance for 3D Semantic Scene Completion

Meng Wang, Shougao Zhang, Wenzhe He, Ruihui Li, Nan Hu, Zhuo Tang, Kenli Li
任务设定 结合卫星图像与地图先验做 3D 语义场景补全
痛点动机 机载图像遮挡、视野受限,导致大范围场景欠约束
解决方案 以卫星图与 OSM 先验为软引导,学习体素级可靠性权重指导特征补全
7

Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution

Weichen Xu, Zhenhua Liu, Lin Luo, Yaobo Liang, Chengtang Yao, Qingyu Mei, Jian Cao, Xixin Cao, Xing Zhang, Jiaolong Yang, Baining Guo
任务设定 机器人操作中 VLA 模型的自适应执行时长选择
痛点动机 固定分块执行时长导致关键操作阶段用到过时动作块
解决方案 提出 BCP 框架,用 continue-or-replan 序列决策头结合强化学习训练,基座 VLA 保持冻结
8

Residual Flow Matching with Dynamic Cross-Interaction for 3D Multi-Person Motion Prediction

Wei Wei, Yinyuan Zhao, Ruixuan Yu
任务设定 预测多人 3D 运动序列,建模个体动力学与人际交互
痛点动机 从纯噪声直接生成骨骼序列会破坏结构一致性,早期交互不可靠
解决方案 提出残差流匹配框架:用确定性粗先验作运动锚点,配合动态跨交互机制同步人际信息
9

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen
任务设定 图像目标视觉导航,同时预测未来观测与路径点轨迹
痛点动机 现有导航策略缺视觉预见性,而世界模型规划开销大
解决方案 提出统一扩散模型,单个 Transformer 中联合去噪未来画面与路径点轨迹,支持无标注视频训练
10

Structure-Aware Robust Fine-Tuning: Defending Vision-Language-Action Robots Against Physical Attention Hijacking

Jinquan Zhang, Dongfu Yin, Run Yang, Yufeng Yan, Zhen Tian, F. Richard Yu
任务设定 防御 VLA 机器人策略遭受物理对抗补丁攻击
痛点动机 对抗贴纸会劫持视觉-动作注意力,致操作任务失败
解决方案 提出结构感知微调(SARF),仅微调视觉编码器做特征锚定与注意力校正,零推理开销
11

DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack

Hoseong Tae, Jong-Seok Lee
任务设定 针对流匹配 VLA 机器人策略的对抗补丁攻击
痛点动机 此前认为流匹配 VLA 天然抗扰动,实因攻击忽略了多步去噪过程
解决方案 提出 DRIFT ,用夹爪贴片攻击去噪速度场首步,攻破几乎所有原可解任务
12

Surface Keypoint Representation for Multi-Object and Articulated Human-Object Interaction Generation

Xiaogang Peng, Zeyu Han, Zichong Meng, Yiming Xie, Jihua Zhu, Gang Hua, Huaizu Jiang
任务设定 多物体、关节物体场景下的全身人-物交互生成
痛点动机 现有 HOI 方法多假设单一刚体物体,难扩展到多物体或关节物体
解决方案 表面关键点轨迹表示物体运动,结合接触距离场引导全身动作生成
13

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong
任务设定 VLN 中分离语义进度追踪与局部动作执行
痛点动机 单一动作监督混淆进度错误与执行错误
解决方案 指令分析模块估计步骤进度,再用动作生成模块据此执行动作
14

DigitCode: Symbolic Tokenization of Hand Motion by Anatomical Units

Haoyu Gu, Haotian Lu, Jingrun Du, Xiao-Ping Zhang
任务设定 手部动作的符号化离散表示与编码方法
痛点动机 连续 MANO 参数无法编辑或索引手指姿态
解决方案 解剖层级(骨骼/手指/整手)分组量化,误差降低 75%
15

A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varying Forces

Rishabh Shukla, Adithya Santhosh, Shaili Gandhi, Samrudh Moode, Satyandra K. Gupta
任务设定 接触密集型双臂拆解操作(如凿、撬)的模仿学习
痛点动机 扩散策略推理延迟高,难以应对断裂引发的快速力变化
解决方案 高层扩散模型低频选择任务原语,低层力控制器高频实时调节保持接触稳定
16

SUV: Future Scene Understanding as Video Generation for End-to-End Driving

Yibo Yuan, Jiacheng Fu, Jiangtong Zhu, Yi Li, Jianhua Han, Meng Tian, Zhuohan Liu, Zhiwei Xiong, Hang Xu, Jianwu Fang, Jianru Xue
任务设定 端到端自动驾驶中的未来场景理解与轨迹规划
痛点动机 现有方法用任务专用头建模场景,扩展性有限
解决方案 预训练视频模型统一生成外观、语义、深度等未来流,联合注意力预测轨迹
17

AIDE: Automated Instruction via Distilled Expertise for Reference-Free Motor Skill Coaching

Yoshiki Ito
任务设定 仅凭学习者姿态序列生成运动技能纠正反馈
痛点动机 专家教练稀缺昂贵,现有方法推理时仍需专家示范
解决方案 教师模型用学习者-专家差异 token 训练,蒸馏出仅需学习者姿态的学生模型
18

PACE: Adaptive Budget Allocation for Time-Efficient Embodied Planning

Yuchen Huang, Xijiang Ying, Zhenhua Ma, Xiaxiang Yuan, Zhijie Gao, Jiayi Huang, Ruichi Mao, Jiazheng Zhang, Hongsheng Ti, Maotao Tian, Rong Shi, Lu Zhao, Shizhuang Zhang, Zhuo Cui, He Wang, Ling Liu, Wei Zhang
任务设定 具身智能体的规划推理与动作执行时间重叠
痛点动机 串行式先推理后执行导致具身部署延迟过高难落地
解决方案 提出交错思考-执行架构动态预算分配器,按执行时间窗自适应调整推理量
19

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki
任务设定 面向长视频的 3D 场景空间理解与定位
痛点动机 现有 3D LMM 在接地、分割任务上落后专用 3D 感知系统
解决方案 多视角几何压缩视觉 token ,结合 3D 位置编码与查询式分割解码器实现语言直接接地 3D 场景
20

ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies

Inkyu Sa, Konstantin Stulov, Rajat Bhageria
任务设定 为 VLA 机器人操作策略提供逐帧进度评估
痛点动机 模仿学习静默失败,无法判断操作何时出错
解决方案 用冻结 DINOv3 加因果 Transformer ,同时输出蒙特卡洛价值和二元错误检测信号
21

Quo Vadis, World Modeling?

Yu Yang, Xuemeng Yang, Licheng Wen, Lingdong Kong, Xiaobin Hu, Dongyue Lu, Wei Chow, Xiyan Huang, Yuxiang Feng, Yue Liao, Jianbiao Mei, Daocheng Fu, Rong Wu, Pinlong Cai, Ran Yi, Ying Tai, Jiangning Zhang, Botian Shi, Yong Liu, Shuicheng Yan
任务设定 探讨世界模型如何为智能体提供交互反馈代理
痛点动机 真实环境交互成本高、慢、不安全且难并行
解决方案 提出智能体中心世界代理概念,将反馈从物理状态预测拓展为六类信息转移代理(动态、空间、执行、记忆、技能、奖励)
22

Enfold: Folding World-Generator Computation into Predictive Representations for Efficient Embodied Control

Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Yichao Yan
任务设定 世界生成器的计算内化为具身控制的预测表征
痛点动机 生成式策略实时推理慢,难以部署到真实机器人
解决方案 仅看当前帧的编码器学习模仿生成器处理未来时的中间状态,部署时跳过生成过程直接输出动作